Главная страница TG News ​Common Crawl — это крупнейший источник обучающих данных для LLM
Mike Blazer
14.08.2026
Mike Blazer

​Common Crawl — это крупнейший источник обучающих данных для LLM

Вот как за 5 минут проверить, попал ли ваш сайт в обучающие данные:

Примечание автора: Чтобы получать подобные советы прямо на почту, подписывайтесь на рассылку по ссылке в моем профиле, пишет Крис Лонг.

Джейсон Мелман вчера поделился классной фишкой на нашей внутренней встрече Nectiv.

Common Crawl недавно выпустил гайд «The AI Visibility Audit» с действительно полезной информацией о том, как вашему сайту попасть в датасет Common Crawl.

Для тех, кто не в курсе, Common Crawl — это, пожалуй, самый крупный источник данных для обучения LLM.

Это огромный публичный ресурс, который большинство передовых моделей почти наверняка использовали для обучения своих баз знаний.

Так вот, в статье они реально показывают, как через командную строку проверить, включен ли ваш сайт в последнюю версию Common Crawl.

Звучит сложно, но на деле все довольно просто.

Покажу пример проверки на DocuSign.

1. Откройте командную строку на вашем устройстве
2. Задайте домен: DOMAIN="docusign(dot)com"
3. Проверьте, есть ли у CCBot доступ к сайту: curl -A "CCBot/2.0" -I "https://$DOMAIN/"
4. Проверьте, есть ли домен в последней версии Common Crawl: curl "https://index(dot)commoncrawl(dot)org/CC-MAIN-2026-21-index?url=$DOMAIN/*&output=json" | head

Затем вы получите ответ, по которому видно, включен ли ваш сайт в последнюю версию.

Если вы видите, что ваш сайт есть в ответе, вы подтверждаете, что Common Crawl его подхватывает.

Тогда у вас будет подтверждение того, могут ли LLM использовать ваш сайт в обучающих данных.

Инсайты комьюнити

— Присутствие в индексе Common Crawl подтверждает только crawlability, а не попадание в обучающую выборку. Утверждение из поста о том, что появление в индексе гарантирует использование сайта LLM, некорректно. AI-лаборатории прогоняют жесткую фильтрацию (dedup, классификаторы качества, perplexity filters) перед запуском обучения. В итоге малоценные страницы краулятся, но отбрасываются; плюс доступность для краулера никогда не гарантирует, что LLM обучится на этой странице, упомянет ее или сошлется.
— Главный рычаг в 2026 году — это извлечение данных (retrieval), а не претрейн, так как обучающие выборки заморожены и содержат потери. Разрешайте CCBot, но также открывайте доступ для GPTBot, PerplexityBot, ClaudeBot и Google-Extended в robots.txt.
— Сначала проверяйте robots.txt через curl. Сайты часто блочат CCBot из-за глобального запрета для AI-ботов, который автоматически вешает CDN или плагин безопасности, а потом удивляются, почему LLM их не видят. Проверяйте это, прежде чем списывать все на проблемы с контентом.
— Дополнительный шаг проверки: скачайте полный отрендеренный сервером HTML с юзер-агентом CCBot, чтобы убедиться, что краулер получает реальный контент, а не пустую оболочку на JavaScript. Команда для Windows PowerShell: curl(dot)exe -A "CCBot/2.0 (https://commoncrawl(dot)org/faq/)" -L -sS "https://example(dot)com/" -o homepage-ccbot(dot)html, а затем откройте сохраненный файл.
Common Crawl работает на основе самостоятельного поиска — краулер сам находит контент, добавить сайт вручную нельзя. Эту базу чаще используют развивающиеся LLM, в то время как фундаментальные модели от OpenAI, Anthropic и Google опираются на нее меньше из-за большого количества дублей и слабой структурированности датасета.

#AI #Crawling #Bots

@MikeBlazerX
⚠️ Закрытый канал: @MikeBlazerPRO

Чо, как вам статья?

Материалы по теме

Подборка полезных тулзов для работы Помимо основного сетапа есть штуки поменьше, которые…
Подборка полезных тулзов для работыПомимо основного сетапа есть штуки поменьше, которые сильно помогают:⚫️ 2csv — ТГ-бот, выгрузка истории сообщений из канала с охватами, реакциями, решарами и комментами. Просто кидаешь ссылку на канал и лутаешь…
Временная пятиминутная почта вместо гмаил ✉️ Вчера в чате общались как человек…
Временная пятиминутная почта вместо гмаил ✉️ Вчера в чате общались как человек создает адс кабы на левые почти, а не гмаил. И вспомнил как еще несколько лет назад создавал адс кабы на почты, которые были сделаны на основе домена в клауде. …
🎲 Криптобиржа OKX ужесточила проверки транзакций, связанных с гемблингом Крупная криптобиржа OKX…
🎲 Криптобиржа OKX ужесточила проверки транзакций, связанных с гемблингомКрупная криптобиржа OKX (суточный объём торгов на спотовом рынке — до $1,7 млрд, входит в топ-10 крупнейших платформ), зарегистрированная на Сейшельских островах, ужесточила…

Вставить свои 5 копеек:

Awesome image
Awesome image Awesome image Awesome image Awesome image
Awesome image