Краулинговый бюджет без мифов: когда роботу действительно не хватает обхода

Как понять, есть ли у сайта проблема crawl budget, какие URL мешают обходу и как приоритизировать параметры, дубли, Sitemap и ошибки сервера.

Обновлено: Автор: Вадим Федоров11 минут чтения
Мураз КакиловЕлизавета ГырбуАнтон ШевцовСевочка ГусейноваАлександр Зимаков+5
Команда Медиакод

Краулинговый бюджет часто используют как объяснение почти любой задержки в индексации: новая страница не появилась, карточка товара не обновилась, сайт редко попадает в обход. Но для небольшого или умеренно растущего проекта это редко первая причина. Если важные страницы появляются в поиске без заметной задержки, Google советует в первую очередь поддерживать Sitemap и следить за отчетом индексирования, а не строить отдельную программу «экономии обхода».

Тема становится практической, когда сайт очень большой, быстро меняется или генерирует много URL без самостоятельной ценности. Тогда робот может тратить обращения на параметры, дубли, пустые комбинации фильтров, старые маршруты и ошибки вместо важных карточек и категорий. Краулинговый бюджет - не счетчик, который нужно увеличить, а выбор робота, какие URL сайт делает доступными и значимыми.

Я начинаю такой разбор не с вопроса «сколько страниц обходит робот». Важнее увидеть, какие страницы нужны бизнесу в ближайший период и получает ли именно этот набор нормальный путь к обходу. Если приоритетные URL доступны, а команда видит их в панелях и на сайте, само колебание числа обращений не является поводом перестраивать весь проект.

Вадим ФедоровВадим ФедоровМенеджер по развитию клиентов

Сначала проверьте, есть ли у сайта реальная проблема обхода

Google называет темой управления crawl budget прежде всего очень крупные сайты с миллионом и более страниц, либо проекты от десяти тысяч URL, которые меняются ежедневно, а также сайты с большой долей Discovered - currently not indexed. Числа являются ориентиром, а не порогом для любой компании. Полная логика описана в официальном руководстве Google.

Поэтому начинать нужно с симптома, а не с термина. Новая важная страница может не попасть в обход из-за слабой внутренней связи, запрета в robots, неправильного canonical или недоступности сервера. Ни один из этих случаев не исправляется общим требованием «дать больше бюджета».

НаблюдениеЧто может означатьПервая проверка
Новые важные URL долго не появляются в поискеСлабая доступность, отсутствие Sitemap, техническое ограничениеПроверить HTML-ссылки, canonical, robots и статус ответа
Робот часто открывает адреса с параметрамиСайт генерирует много вариантов одного содержанияНайти источник параметров во внутренних ссылках и шаблонах
В отчетах много 5xx или таймаутовСервер не выдерживает часть обходаСопоставить время ошибок и журнал запросов
В Sitemap заявлено много URL, но приоритетные не обновляютсяВ карту попал смешанный набор ценности и технических страницСверить Sitemap с каноническими страницами и бизнес-приоритетом

Яндекс Вебмастер тоже дает наблюдаемые данные: в разделе «Статистика обхода» можно увидеть дату посещения, URL и код ответа, а также отфильтровать конкретный раздел. Количество обращений может меняться по дням и само по себе не является сигналом падения ранжирования. Это стоит учитывать, прежде чем превращать один график в срочную задачу. Подробнее о возможностях отчета сказано в справке Яндекса.

Из чего складывается «бюджет» на самом деле

В документации Google различаются два связанных фактора: способность сайта принять обход без перегрузки и спрос робота на конкретные URL. Быстрый сервер сам по себе не сделает неважную страницу интересной, а полезная страница может быть пропущена, если до нее трудно дойти или вокруг нее существует большой слой копий.

ФакторВопрос для командыЧто меняет ситуацию
Доступность сервераМожет ли сайт стабильно отвечать в моменты обхода?Устранить 5xx, таймауты и узкие места ответа
Инвентарь URLСколько адресов действительно нужно обходить?Убрать технические варианты из ссылок и карты сайта
Внутренняя структураДо важных страниц можно дойти понятным маршрутом?Связать категории, хабы, карточки и актуальные материалы
АктуальностьРоботу есть причина возвращаться к странице?Обновлять значимое содержание и корректно указывать изменения

Это снимает распространенное заблуждение: не существует одной кнопки, которая «увеличивает бюджет». Результат складывается из того, как сайт отвечает, какие адреса производит и какие из них команда последовательно называет основными. Google рекомендует управлять URL-инвентарем, объединять дубли и поддерживать HTTP-кэширование с 304 Not Modified, когда содержание не менялось.

В приоритете я сравниваю не количество технических замечаний, а потерю от каждого класса URL. Если каталог создает сотни одинаковых вариантов, а новые карточки обновляются редко, сначала нужно остановить генерацию лишних адресов. Настройка отчета без этого покажет проблему красивее, но не изменит маршрут робота.

Вадим ФедоровВадим ФедоровМенеджер по развитию клиентов

Найдите классы URL, а не тысячи отдельных адресов

Большой список из краулера или логов легко превращается в бесконечную очередь. Полезнее сгруппировать URL по механике появления. Обычно один шаблон создает сразу тысячи адресов, поэтому исправление в шаблоне дает больший эффект, чем ручная обработка отдельных страниц.

Класс URLПочему расходует внимание роботаТипичное решение
Фильтры без поисковой ролиОдни и те же карточки доступны в десятках сочетанийОставить только подтвержденные посадочные, остальные не продвигать как отдельные страницы
Сортировки и технические параметрыМеняется порядок, а не смысл спискаНе вести на них внутренними ссылками, задать подходящее правило индексирования
Дубли маршрутовОдин материал открывается по нескольким адресамВыбрать канонический URL, обновить ссылки и устранить старые варианты
Пустые категории и архивыАдрес существует, но не помогает выбрать товар или услугуУбрать из публичной структуры или вернуть корректный статус
Служебные действияВ URL отражаются корзина, авторизация, поиск или состояние интерфейсаНе делать их точками входа для обхода

Работа с фильтрами требует отдельного решения по ценности каждой комбинации. В материале о SEO-фильтрах интернет-магазина разобран критерий: индексируемая страница должна отвечать на самостоятельный спрос, а не существовать только потому, что интерфейс умеет собрать параметры. Здесь важен следующий слой: после выбора полезных страниц остальные варианты не должны продолжать появляться во внутренних ссылках и Sitemap как равные им.

Соберите один реестр классов URL с владельцем, источником появления и решением для каждого класса. Тогда задача перестает быть списком из десятков тысяч строк: команда видит, какой шаблон нужно менять и как проверить результат после релиза.

Три действия, которые дают эффект раньше остальных

Когда класс URL определен, следующий шаг должен быть конкретным. Я бы не запускал одновременно все возможные изменения. На старте достаточно выбрать действие, которое освобождает обход для самых важных страниц или устраняет реальную недоступность.

ПриоритетКогда выбиратьПрактический результат
Очистить внутренние ссылкиТехнические параметры и старые URL живут в меню, карточках или шаблонахРобот получает меньше ложных маршрутов при следующем обходе
Привести в порядок дублиОдин контент открывается по нескольким стабильным адресамСсылки, canonical и Sitemap указывают на одну версию
Устранить проблемы ответаВ важных разделах есть 5xx, таймауты или перегрузкаРобот может получить страницы без лишних повторных ошибок
Сократить бесполезный инвентарьПустые, служебные или устаревшие URL заметно преобладаютВ обходе остается больше места для ценных документов

Не стоит начинать с robots.txt только потому, что он быстро меняется. Закрытие адреса подходит для страниц, которые не должны обходиться, но не исправляет уже созданный хаос в ссылках, Sitemap или canonical. Яндекс отдельно рекомендует сначала посмотреть последние обращения к сайту и обращать внимание на GET-параметры, которые часто ведут к одинаковому содержанию. Его рекомендации по снижению нагрузки полезны именно как диагностика классов URL, а не как повод блокировать все подряд.

Сильная первая итерация - это не максимальное число закрытых адресов, а меньший разрыв между списком нужных страниц и тем, что реально обходит робот.

Sitemap помогает объявить приоритет, но не заменяет структуру

Sitemap нужен, чтобы сообщить поисковым системам о текущем наборе важных URL. Он особенно полезен, когда проект большой, новый или имеет страницы, до которых трудно дойти только по ссылкам. Но карта сайта не делает любой адрес нужным и не заменяет внутреннюю навигацию.

Ошибка в SitemapПочему она мешаетЧто сделать
В файл включены редиректы, неканонические и закрытые URLСайт сообщает противоречивые сигналы о главных страницахОставить только доступные канонические страницы
Важные новые URL не попадают в файлРобот получает неполный список измененийПроверить генератор и источник данных
lastmod меняется при каждом техническом выпускеСигнал обновления перестает отражать смысловые измененияПередавать дату значимого обновления содержания
Одна карта смешивает все состояния URLНельзя быстро увидеть отклонение по типу страницРазделить контроль по шаблонам и важным группам

Для сайта полезно договориться, где источник истины для URL: CMS, продуктовый каталог, реестр услуг или статический контент. Затем проверить, что генератор Sitemap берет только финальные адреса из этого источника. Подробная приемка файла разобрана в руководстве по XML Sitemap, а сама карта должна поддерживать уже принятую структуру, а не пытаться ее заменить.

Как проверить, что задача решена

Проверять результат нужно по одному и тому же набору URL до и после изменения. Это может быть несколько важных категорий, новые карточки, глубокие страницы пагинации и адреса с параметрами. Важно не ожидать мгновенной перемены всех графиков, а увидеть, что сайт перестал сам создавать лишние точки обхода и сохранил доступ к нужным.

ПроверкаВопросПризнак готовности
Краулер или обход HTMLЕсть ли ссылки на параметры, старые адреса и пустые разделы?Основные маршруты ведут на финальные URL
SitemapСодержит ли файл только полезные канонические страницы?Нет технических классов URL в списке
Поисковые панелиКак робот посещает выбранную контрольную выборку?Важные URL доступны и не получают неожиданные ошибки
Серверные логиНа какие классы URL приходятся обращения роботов?Видно изменение после выпуска и нет нового источника мусора
Бизнес-приоритетУчитывает ли выборка товары, услуги и материалы, которые нужно развивать?Контроль не сводится к общему числу запросов

Внутренние ссылки - часть этой проверки. Если нужно увидеть, почему значимый материал не получает входов, разберите страницы-сироты отдельно. Логи сервера дают точную картину уже состоявшихся обращений, но их имеет смысл читать после того, как команда определила контрольные классы URL и ожидаемый эффект.

Для меня хороший итог этой работы выглядит так: владелец каталога и команда могут назвать несколько важных типов страниц, показать их путь из сайта и объяснить, какие технические варианты больше не должны конкурировать за обход. После этого у проверки появляется дата, выборка и понятный ответственный, а не общий страх, что робот «не успевает».

Вадим ФедоровВадим ФедоровМенеджер по развитию клиентов

Не создавайте новую проблему после исправления

Мусорные URL часто возвращаются не потому, что кто-то отменил старую настройку, а потому что новый компонент снова добавил сортировку в ссылки, каталог начал формировать пустые сочетания или при миграции сохранились параллельные маршруты. Поэтому правило должно жить не только в техническом аудите, но и в приемке изменений.

Перед выпуском нового шаблона проверяйте не только красивый URL, но и все варианты, которые он способен породить: параметры, пустые результаты, пагинацию, старые маршруты и ссылки из интерфейса. Это дает команде короткий контрольный список и не позволяет одному изменению создать новый слой адресов.

Для большого проекта разумно идти по разделам: выбрать один контур, подтвердить его нужные URL, убрать лишние маршруты, повторить контрольную выборку и только потом расширять практику. Такой порядок соответствует авторскому принципу приоритизации: сначала убрать ограничение, которое влияет на доступ к важному содержанию, затем масштабировать работающую модель.

Автор: Вадим Федоров

Частые вопросы

Обычно это не первая задача. Сначала убедитесь, что важные страницы доступны по ссылкам, не закрыты техническими правилами, имеют корректный canonical и попадают в актуальный Sitemap. К теме бюджета переходят, когда наблюдаются реальные задержки обхода важных URL или большое число бесполезных вариантов.

Нет. В Sitemap стоит включать канонические страницы, которые должны участвовать в поиске. Добавление параметров, дублей, редиректов и служебных адресов смешивает приоритеты и не заменяет понятную внутреннюю структуру.

Robots.txt полезен для конкретных классов URL, которые не должны обходиться. Но сначала надо убрать их из внутренних ссылок и определить, какой технический способ соответствует ситуации: canonical, noindex, редирект или правильный HTTP-статус. Один запрет не делает структуру сайта понятнее.

Сравните URL из статистики обхода или логов с реестром основных страниц. Повторяющиеся параметры сортировки, фильтрации, состояния интерфейса или технических меток укажут на класс URL, который стоит разобрать на уровне шаблона.

Нет. Для большинства задач достаточно панелей поисковых систем и контрольной выборки URL. Логи полезны, когда нужно подтвердить фактические обращения робота к большому числу адресов или проверить эффект изменения после выпуска.

Усилить результат

Если выводы из материала совпадают с вашей задачей, эти направления помогают перейти от чтения к действию.

Запишитесь на консультацию —и мы соберём план роста вашего проекта

Мураз Какилов

Что разберём за 45 минут. До встречи изучим ваш продукт, сайт, рекламу и аналитику, чтобы на созвоне сразу перейти к цифрам и пути клиента.

Определим, где теряются заявки и бюджет: в канале, предложении, посадочной странице, форме, аналитике или обработке обращений.

По итогам у вас останется порядок действий: что исправить в первую очередь, какую гипотезу проверить следующей и по каким показателям оценивать эффект.

Мураз КакиловCEO Медиакод. Отвечаю за стратегию агентства и качество работы команды. Каждую задачу разбирают профильные специалисты по рекламе, SEO, SMM, разработке и аналитике. Мы смотрим на маркетинг целиком — от первого касания до заявки и продажи — и находим точки роста, которые можно измерить.

За 45 минут найдём, где теряются заявки и что исправить в первую очередь