Девять карточек с параметрами. Две — про конкретный сорт
Мы обошли 58 доменов сегмента «семена» двумя независимыми детекторами. Первый искал страницы товара и считал на них пары «параметр — значение». Второй искал страницу, посвящённую конкретному гибриду. Первый нашёл девять доменов, второй — два. Пересечение множеств — один домен. Разница между этими числами и есть находка.
Поправка к первой редакции. Первая версия этого материала утверждала, что карточка продукта есть у двух сайтов из 58. Это было неверно: под одно определение мы свели результаты двух разных детекторов с разными предметами измерения. Замечание пришло от внешнего рецензента, проверено по исходным выгрузкам и подтвердилось. Текст переписан, и изменились не цифры, а вывод.
Два детектора, и путать их нельзя
Первый отвечает на вопрос «есть ли на сайте описанные товары». Второй — на вопрос «найдёт ли покупатель страницу того сорта, название которого он знает». Это разные вопросы, и ответы на них расходятся.
Первый детектор: воронка на 58 доменов
У 27 доменов карточек товара не нашлось вовсе. Из них у 23 обход завершился штатно — значит страниц товара действительно нет; у четырёх обход оборвался, и за них мы не отвечаем.
Девятнадцать доменов — отдельный случай. Карточки у них есть, они обойдены, и на них ноль пар параметров. Страницы существуют, но пар «параметр — значение» детектор на них не распознал. Если их там действительно нет, читателю нечего прочитать, машине нечего забрать.
Второй детектор: имя сорта
Второй детектор работает по всем 58 доменам: он ищет упоминание продукта и страницу под него, и таймаут обхода ему не мешает.
Главное расхождение
Девять доменов имеют карточку товара с двумя и более параметрами. Только у двух карточка привязана к конкретному сорту так, что детектор её опознал. Пересечение двух множеств — один домен.
То есть у большинства из девяти параметры лежат на страницах, которые не отвечают на вопрос «расскажите про сорт с таким названием». Это карточки категорий, общие страницы линеек, таблицы без адресов у строк.
Расхождение идёт в обе стороны, и это стоит назвать прямо. Из двух найденных карточек сорта в пересечение попала та, где вместо значений стоят прочерки. У второй — со значениями «урожайность 88» и «срок 150–160» — детектор карточек товара насчитал ноль пар: он обошёл две страницы каталога этого домена и до нужной не дошёл.
Ни один из двух детекторов не описывает сайт целиком. Они читают разные страницы одного и того же ресурса, и именно поэтому их результаты нельзя складывать в одно число.
Данные есть. Проблема в адресации
Детектор нашёл параметры местами в изрядном количестве: один сайт описывает товар двумястами тридцатью семью парами «параметр — значение». Второй результат — 27 пар, третий — 13. Медиана среди тех двенадцати, у кого параметры есть вообще, — пять с половиной.
Насыщенная карточка технически возможна и уже существует. Её сделал участник того же рынка.
Проблема не в отсутствии данных, а в адресации. Покупатель приходит с именем сорта. Страница, которая по этому имени открывается, в нашей выборке чаще всего либо не найдена, либо не содержит распознанных параметров.
И отдельно про две найденные карточки сорта. У одной из двух в полях параметров стоят прочерки: поле «срок» есть, значение — тире; поле «урожайность» есть, значение — тире. Формально критерий выполнен. Фактически покупатель не узнаёт ничего. Детектор считает поля, а не заполненность, поэтому «две» — верхняя граница, а не точное число.
Каталог есть. Карточки сорта в нём нет
Отдельный раздел «Каталог» или «Продукция» обнаружен у 37 доменов из 53 обойдённых.
Ещё пять сайтов из 53 отдают каталог только в PDF.
Поправка про PDF. В первой редакции было сказано, что PDF-каталог не может быть приведён как источник ни поисковой системой, ни языковой моделью. Это неверно: PDF индексируется, у файла есть собственный адрес. Верно другое и более узкое: у отдельной страницы внутри файла адреса нет, поэтому по названию конкретного сорта посадочной страницы не получится, а обновление карточки требует перевыпуска всего файла.
Как выглядит карточка сорта, которой почти ни у кого нет
Свой адрес. Одна страница — один сорт или гибрид. Адрес человекочитаемый и постоянный, не меняющийся при пересборке каталога. Это первое и главное: девять сайтов уже имеют параметры, но не имеют адреса, который открывается по имени сорта.
Параметры парами, текстом в HTML. Культура, группа созревания, срок вегетации в днях, потенциальная урожайность с указанием условий замера, норма высева, устойчивость к конкретным болезням и гербицидам, регионы допуска.
Значения вместо прочерков. Поле без значения хуже отсутствующего поля: оно показывает, что данные есть, но вам их не дали.
Ссылка в государственный реестр. Номер в реестре селекционных достижений и прямая ссылка на запись. Покупатель всё равно пойдёт проверять — лучше дать ссылку самому.
Микроразметка товара. В сегменте подтверждена у 7 доменов из 53.
Чего этот обход не доказывает
Не доказывает, что у компаний нет данных о сортах. Наоборот: у девяти доменов параметры найдены, а у одного их больше двухсот на карточку. Замер говорит о том, где эти данные лежат.
Не доказывает, что карточка продаёт. Связь между карточкой и сделкой не исследовалась.
Не доказывает причинности с ответами языковых моделей. В отдельном замере того же сегмента источники в ответах сохранились у двух моделей с поиском. На сайты самих компаний выборки у обеих пришлось около 6 % ссылок на источники. На реестры и справочники юрлиц — 28 % у Алисы с поиском и 2 % у GPT-4o с поиском: какой сайт модель берёт за источник, зависит от модели больше, чем от чего-либо ещё в этом замере. Сопоставление двух наборов наблюдений гипотезу порождает, но не доказывает: эксперимент с добавлением карточек мы не ставили.
Детектор карточки сорта считает поля, а не заполненность. Поэтому «две» — верхняя граница.
Отрицательные случаи вручную не перепроверялись. Страницы на JavaScript, нестандартные шаблоны и таблицы детектор мог не распознать. Правильная формулировка результата — «не распознано этим способом», а не «отсутствует».
Ограничение обхода. У каждого домена обходилось не больше тридцати страниц продукции. Для больших каталогов это выборка.
Пять доменов из 58 не обойдены полностью в слоях 3 и 4. Они войдут в январский срез.
Комментарии (0)