Опубликовано 2 часа назад

Девять карточек с параметрами. Две — про конкретный сорт

Мы обошли 58 доменов сегмента «семена» двумя независимыми детекторами. Первый искал страницы товара и считал на них пары «параметр — значение». Второй искал страницу, посвящённую конкретному гибриду. Первый нашёл девять доменов, второй — два. Пересечение множеств — один домен. Разница между этими числами и есть находка.

Поправка к первой редакции. Первая версия этого материала утверждала, что карточка продукта есть у двух сайтов из 58. Это было неверно: под одно определение мы свели результаты двух разных детекторов с разными предметами измерения. Замечание пришло от внешнего рецензента, проверено по исходным выгрузкам и подтвердилось. Текст переписан, и изменились не цифры, а вывод.

Два детектора, и путать их нельзя

Первый отвечает на вопрос «есть ли на сайте описанные товары». Второй — на вопрос «найдёт ли покупатель страницу того сорта, название которого он знает». Это разные вопросы, и ответы на них расходятся.

Первый детектор: воронка на 58 доменов

У 27 доменов карточек товара не нашлось вовсе. Из них у 23 обход завершился штатно — значит страниц товара действительно нет; у четырёх обход оборвался, и за них мы не отвечаем.

Девятнадцать доменов — отдельный случай. Карточки у них есть, они обойдены, и на них ноль пар параметров. Страницы существуют, но пар «параметр — значение» детектор на них не распознал. Если их там действительно нет, читателю нечего прочитать, машине нечего забрать.

Второй детектор: имя сорта

Второй детектор работает по всем 58 доменам: он ищет упоминание продукта и страницу под него, и таймаут обхода ему не мешает.

Главное расхождение

Девять доменов имеют карточку товара с двумя и более параметрами. Только у двух карточка привязана к конкретному сорту так, что детектор её опознал. Пересечение двух множеств — один домен.

То есть у большинства из девяти параметры лежат на страницах, которые не отвечают на вопрос «расскажите про сорт с таким названием». Это карточки категорий, общие страницы линеек, таблицы без адресов у строк.

Расхождение идёт в обе стороны, и это стоит назвать прямо. Из двух найденных карточек сорта в пересечение попала та, где вместо значений стоят прочерки. У второй — со значениями «урожайность 88» и «срок 150–160» — детектор карточек товара насчитал ноль пар: он обошёл две страницы каталога этого домена и до нужной не дошёл.

Ни один из двух детекторов не описывает сайт целиком. Они читают разные страницы одного и того же ресурса, и именно поэтому их результаты нельзя складывать в одно число.

Данные есть. Проблема в адресации

Детектор нашёл параметры местами в изрядном количестве: один сайт описывает товар двумястами тридцатью семью парами «параметр — значение». Второй результат — 27 пар, третий — 13. Медиана среди тех двенадцати, у кого параметры есть вообще, — пять с половиной.

Насыщенная карточка технически возможна и уже существует. Её сделал участник того же рынка.

Проблема не в отсутствии данных, а в адресации. Покупатель приходит с именем сорта. Страница, которая по этому имени открывается, в нашей выборке чаще всего либо не найдена, либо не содержит распознанных параметров.

И отдельно про две найденные карточки сорта. У одной из двух в полях параметров стоят прочерки: поле «срок» есть, значение — тире; поле «урожайность» есть, значение — тире. Формально критерий выполнен. Фактически покупатель не узнаёт ничего. Детектор считает поля, а не заполненность, поэтому «две» — верхняя граница, а не точное число.

Каталог есть. Карточки сорта в нём нет

Отдельный раздел «Каталог» или «Продукция» обнаружен у 37 доменов из 53 обойдённых.

Ещё пять сайтов из 53 отдают каталог только в PDF.

Поправка про PDF. В первой редакции было сказано, что PDF-каталог не может быть приведён как источник ни поисковой системой, ни языковой моделью. Это неверно: PDF индексируется, у файла есть собственный адрес. Верно другое и более узкое: у отдельной страницы внутри файла адреса нет, поэтому по названию конкретного сорта посадочной страницы не получится, а обновление карточки требует перевыпуска всего файла.

Как выглядит карточка сорта, которой почти ни у кого нет

Свой адрес. Одна страница — один сорт или гибрид. Адрес человекочитаемый и постоянный, не меняющийся при пересборке каталога. Это первое и главное: девять сайтов уже имеют параметры, но не имеют адреса, который открывается по имени сорта.

Параметры парами, текстом в HTML. Культура, группа созревания, срок вегетации в днях, потенциальная урожайность с указанием условий замера, норма высева, устойчивость к конкретным болезням и гербицидам, регионы допуска.

Значения вместо прочерков. Поле без значения хуже отсутствующего поля: оно показывает, что данные есть, но вам их не дали.

Ссылка в государственный реестр. Номер в реестре селекционных достижений и прямая ссылка на запись. Покупатель всё равно пойдёт проверять — лучше дать ссылку самому.

Микроразметка товара. В сегменте подтверждена у 7 доменов из 53.

Чего этот обход не доказывает

Не доказывает, что у компаний нет данных о сортах. Наоборот: у девяти доменов параметры найдены, а у одного их больше двухсот на карточку. Замер говорит о том, где эти данные лежат.

Не доказывает, что карточка продаёт. Связь между карточкой и сделкой не исследовалась.

Не доказывает причинности с ответами языковых моделей. В отдельном замере того же сегмента источники в ответах сохранились у двух моделей с поиском. На сайты самих компаний выборки у обеих пришлось около 6 % ссылок на источники. На реестры и справочники юрлиц — 28 % у Алисы с поиском и 2 % у GPT-4o с поиском: какой сайт модель берёт за источник, зависит от модели больше, чем от чего-либо ещё в этом замере. Сопоставление двух наборов наблюдений гипотезу порождает, но не доказывает: эксперимент с добавлением карточек мы не ставили.

Детектор карточки сорта считает поля, а не заполненность. Поэтому «две» — верхняя граница.

Отрицательные случаи вручную не перепроверялись. Страницы на JavaScript, нестандартные шаблоны и таблицы детектор мог не распознать. Правильная формулировка результата — «не распознано этим способом», а не «отсутствует».

Ограничение обхода. У каждого домена обходилось не больше тридцати страниц продукции. Для больших каталогов это выборка.

Пять доменов из 58 не обойдены полностью в слоях 3 и 4. Они войдут в январский срез.


Комментарии (0)