Common Crawl — некоммерческая организация, занимающаяся веб-скрапингом и предоставляющая свои архивы и наборы данных в свободном доступе. Основана в 2007 году. Штаб-квартира расположена в Сан-Франциско и Лос-Анджелесе, Калифорния. Архив Common Crawl содержит петабайты данных, собранных с 2008 года, а ежемесячные обходы охватывают от 94 до 163 миллионов доменов. Данные хранятся на Amazon Web Services и других облачных платформах.
В контексте поисковой оптимизации (SEO) Common Crawl приобрёл принципиально новое значение с распространением генеративного искусственного интеллекта. Если традиционно SEO фокусировалось на ранжировании в поисковых системах, то современная оптимизация требует присутствия в данных, на которых обучаются большие языковые модели (LLM). Как отмечается в отраслевых публикациях: «Старый мир — это индексация и ранжирование. Новый мир — это обучение и извлечение. Если вас нет в обходе, вас нет в модели». Common Crawl — это огромная бесплатная библиотека интернета, которую компании, создающие ИИ, используют в качестве «учебника» для своих моделей. Если вашего сайта нет в этой библиотеке, ИИ-модели (такие как ChatGPT) могут о вас просто не знать.
Common Crawl была основана в 2007 году в Сан-Франциско. Публикация результатов обходов началась в 2011 году. К 2013 году такие сервисы, как TinEye, уже строили свои продукты на основе данных Common Crawl. Организация была задумана как альтернатива данным Google, предоставляющая более свежие и эффективные для анализа данные по сравнению с Wayback Machine от Internet Archive.
К 2015 году в архиве Common Crawl насчитывалось 1,8 миллиарда веб-страниц. Изначально обход начинался со списка URL, переданного поисковой системой Blekko. Организация использует Amazon Web Services, что позволяет удерживать средние ежемесячные вычислительные затраты на уровне $2 000–4 000.
До 2023 года Common Crawl был известен преимущественно в академических кругах. Ситуация изменилась с бумом генеративного ИИ: в 2023 году организация начала получать значительную финансовую поддержку от AI-компаний, включая Anthropic и OpenAI, каждая из которых пожертвовала по $250 000. Данные Common Crawl использовались для обучения модели Gemini от Google DeepMind. К апрелю 2023 года Common Crawl захватывал 3,1 миллиарда веб-страниц. К 2024 году число академических исследований, ссылающихся на Common Crawl, превысило 10 000, а вместе с набором данных The Pile он стал одним из двух основных источников для обучения ИИ-моделей.
Технические аспекты
Архитектура обхода
Краулер Common Crawl — CCBot — построен на основе Apache Nutch и Hadoop. Ключевые инженерные решения отличают Common Crawl от наивной реализации: используется адаптивная задержка при получении HTTP-кодов 429 или 5xx, а не статические ограничения на количество запросов к хосту — CCBot замедляется при любых признаках перегрузки сервера.
Краулеры Common Crawl соблюдают политики nofollow и robots.txt. Организация также ведёт Opt-Out Registry — реестр исключений: когда сайт запрашивает исключение или угрожает судебным иском, содержимое удаляется не только из Common Crawl.
Веб-граф и метрики авторитетности
Ежемесячно Common Crawl публикует данные Web Graph — веб-графа, содержащего информацию о ссылочной структуре интернета. Полный веб-граф Common Crawl содержит около 607 миллионов записей о доменах. В рамках этого набора данных вычисляются две ключевые метрики авторитетности:
Harmonic Centrality (HC) — мера того, насколько домен «близок» ко всем остальным доменам в веб-графе. Домен с высоким HC может достичь многих других доменов через меньшее количество ссылочных переходов. Эта метрика используется для определения приоритетов обхода: сайты с более высокими показателями HC сканируются чаще.
PageRank — классическая мера авторитетности домена, основанная на качестве и количестве входящих ссылок.
Эти метрики доступны в публичных релизах и используются самим CCBot для управления процессом обхода.
Ограничения при обходе
До марта 2025 года (релиз CC-MAIN-2025-13) порог усечения содержимого составлял 1 МиБ. Начиная с мартовского обхода 2025 года, этот лимит был увеличен до 5 МиБ. Усечение необходимо для обработки бесконечных или исключительно больших потоков данных (например, радиопотоков).
Применение в SEO
От SEO к AIO (AI Optimization)
Традиционная поисковая оптимизация эволюционирует в «AIO» — оптимизацию для искусственного интеллекта. Ключевое изменение: пользователи больше не вводят короткие запросы из двух-трёх слов, а задают развёрнутые вопросы, часто голосом. В этом контексте присутствие в тренировочных данных ИИ-моделей становится таким же стратегически важным, каким раньше было ранжирование в поисковых системах.
Как отмечают эксперты: «Прежде чем работать над контентом, прежде чем заниматься техническим SEO, прежде чем строить ссылочную массу, сайт должен быть доступен для краулеров, которые дополняют AI-тренировочные данные».
Аудит видимости в AI
В июне 2026 года Common Crawl опубликовал The AI Visibility Audit — бесплатное руководство для SEO- и GEO-специалистов. Руководство объясняет:
как AI-системы обнаруживают контент;
почему включение в тренировочные данные ведёт себя как фактор ранжирования;
как провести повторяемый аудит из пяти проверок с использованием только бесплатных инструментов примерно за 90 минут.
Руководство также рассматривает, почему настройки CDN и WAF по умолчанию теперь незаметно блокируют ИИ-краулеров, и почему AI по-прежнему склоняется к английскому языку (доля английского в последнем обходе составляет примерно 41%).
Инструменты для SEO-аналитики
CC Rank Checker — бесплатный инструмент, созданный SEO-консультантом Метеханом Ешильюртом, который индексирует примерно 18 миллионов доменов за пять временных периодов с 2023 по 2025 год. Инструмент позволяет:
проверять HC Rank и PageRank любого домена;
просматривать историю рангов по периодам;
отслеживать изменения авторитетности;
сравнивать до 10 доменов одновременно.
Common Crawl Index Server () позволяет искать любой URL-шаблон в архивах обходов, выбирая период обхода (архивы охватывают годы, самый свежий — CC-MAIN-2025-51). Это быстрый способ подтвердить, что контент попадает в набор данных, используемый для обучения AI.
Apify Common Crawl Scraper позволяет обнаруживать архивные страницы сайта, исторические URL, даты захвата, HTTP-статусы и MIME-типы для SEO-аудита, разведывательного анализа доменов и исследований.
Анализ обратных ссылок
Common Crawl используется для аудита обратных ссылок: индекс CDX позволяет бесплатно запрашивать входящие ссылки на домен. Данные обновляются ежеквартально, результаты могут отставать на 1–3 месяца.
Влияние на SEO-практику
Распространённая ошибка: блокировка CCBot
Многие SEO-специалисты непреднамеренно блокируют свои сайты от AI-поиска, ограничивая CCBot в файле robots.txt. Это делает контент невидимым для AI-систем, поскольку он не попадает в тренировочные данные.
Пример из практики: Детская больница Лос-Анджелеса — один из ведущих педиатрических онкологических центров США. Однако когда родители ищут в Gemini или ChatGPT «куда отвести ребёнка с лейкемией в Лос-Анджелесе?», больница не отображается. Причина: сайт находится за Cloudflare, чьи настройки по умолчанию добавляют robots.txt, блокирующий ИИ-краулеров, включая CCBot. В мире AI-поиска этот ведущий госпиталь фактически не существует.
Прозрачность краулера
Common Crawl реализовал файл ccbot.json по адресу , предоставляющий информацию о диапазонах IP-адресов краулера.
Критика и спорные моменты
В ноябре 2025 года расследование, проведённое технологическим журналистом Алексом Рейснером для The Atlantic, выявило, что Common Crawl вводил издателей в заблуждение относительно соблюдения платных paywall-ограничений при скрапинге, а также не выполнял запросы издателей на удаление их контента из баз данных. Организация показывала в публичной поисковой функции на своём сайте, что для запросивших удаление сайтов нет записей, тогда как на самом деле эти сайты всё ещё присутствовали в архивах.