Главная страница TG News ​Common Crawl — это КРУПНЕЙШИЙ источник обучающих данных для LLM. Вот как…
Mike Blazer
14.08.2026
Mike Blazer

​Common Crawl — это КРУПНЕЙШИЙ источник обучающих данных для LLM. Вот как…

Common Crawl — это КРУПНЕЙШИЙ источник обучающих данных для LLM. Вот как за 5 минут проверить, попал ли ваш сайт в обучающие данные:

Примечание автора: Чтобы получать подобные советы прямо на почту, подписывайтесь на рассылку по ссылке в моем профиле, пишет Крис Лонг.

Джейсон Мелман вчера поделился классной фишкой на нашей внутренней встрече Nectiv.

Common Crawl недавно выпустил гайд "The AI Visibility Audit" с действительно полезной информацией о том, как вашему сайту попасть в датасет Common Crawl.

Для тех, кто не в курсе, Common Crawl — это, пожалуй, самый крупный источник данных для обучения LLM.

Это огромный публичный ресурс, который большинство передовых моделей почти наверняка использовали для обучения своих баз знаний.

Так вот, в статье они реально показывают, как через командную строку проверить, включен ли ваш сайт в последнюю версию Common Crawl.

Звучит сложно, но на деле все довольно просто.

Покажу пример проверки на DocuSign.

1. Откройте командную строку на вашем устройстве
2. Задайте домен: DOMAIN="docusign(dot)com"
3. Проверьте, есть ли у CCBot доступ к сайту: curl -A "CCBot/2.0" -I "https://$DOMAIN/"
4. Проверьте, есть ли домен в последней версии Common Crawl: curl "https://index(dot)commoncrawl(dot)org/CC-MAIN-2026-21-index?url=$DOMAIN/*&output=json" | head

Затем вы получите ответ, по которому видно, включен ли ваш сайт в последнюю версию.

Если вы видите, что ваш сайт есть в ответе, вы подтверждаете, что Common Crawl его подхватывает.

Тогда у вас будет подтверждение того, могут ли LLM использовать ваш сайт в обучающих данных.

Инсайты комьюнити

— Присутствие в индексе Common Crawl подтверждает только crawlability, а не попадание в обучающую выборку. Утверждение из поста о том, что появление в индексе гарантирует использование сайта LLM, некорректно. AI-лаборатории прогоняют жесткую фильтрацию (dedup, классификаторы качества, perplexity filters) перед запуском обучения. В итоге малоценные страницы краулятся, но отбрасываются; плюс доступность для краулера никогда не гарантирует, что LLM обучится на этой странице, упомянет ее или сошлется.
— Главный рычаг в 2026 году — это извлечение данных (retrieval), а не претрейн, так как обучающие выборки заморожены и содержат потери. Разрешайте CCBot, но также открывайте доступ для GPTBot, PerplexityBot, ClaudeBot и Google-Extended в robots.txt.
— Сначала проверяйте robots.txt через curl. Сайты часто блочат CCBot из-за глобального запрета для AI-ботов, который автоматически вешает CDN или плагин безопасности, а потом удивляются, почему LLM их не видят. Проверяйте это, прежде чем списывать все на проблемы с контентом.
— Дополнительный шаг проверки: скачайте полный отрендеренный сервером HTML с юзер-агентом CCBot, чтобы убедиться, что краулер получает реальный контент, а не пустую оболочку на JavaScript. Команда для Windows PowerShell: curl(dot)exe -A "CCBot/2.0 (https://commoncrawl(dot)org/faq/)" -L -sS "https://example(dot)com/" -o homepage-ccbot(dot)html, а затем откройте сохраненный файл.
Common Crawl работает на основе самостоятельного поиска — краулер сам находит контент, добавить сайт вручную нельзя. Эту базу чаще используют развивающиеся LLM, в то время как фундаментальные модели от OpenAI, Anthropic и Google опираются на нее меньше из-за большого количества дублей и слабой структурированности датасета.

#AI #Crawling #Bots

@MikeBlazerX
⚠️ Закрытый канал: @MikeBlazerPRO

Чо, как вам статья?

Материалы по теме

#Новости #МФО 🟢 1. Правительство усилило контроль за взысканием долгов МФО и…
#Новости #МФО🟢 1. Правительство усилило контроль за взысканием долгов МФО и банков.С 1 сентября 2026 года банки и МФО попадут под более жесткий риск‑контур ФССП: повторное непредоставление отчета о возврате просроченной задолженности может стать…
Сайт о Counter-Strike неожиданно обогнал известных казино-партнёрок по некоторым из самых дорогих…
Сайт о Counter-Strike неожиданно обогнал известных казино-партнёрок по некоторым из самых дорогих гемблинг-запросов в США.Как сайт о Counter-Strike привлёк 71 000 посетителей из казино-тематикиHLTV.org известен как:– площадка с результатами матчей…
🔥 Министерство антимонопольного регулирования и торговли Беларуси (МАРТ) подготовило пакет новых ограничений…
🔥 Министерство антимонопольного регулирования и торговли Беларуси (МАРТ) подготовило пакет новых ограничений для игорного маркетинга в стране. Сроки возможного принятия изменений пока неизвестны. iGaming PUSH

Вставить свои 5 копеек:

Awesome image
Awesome image Awesome image Awesome image Awesome image
Awesome image