Техническая база сайта

Краулинговый бюджет: почему робот не доходит до половины сайта

Ещё говорят: бюджет обхода, crawl budget, лимит обхода

Коротко

Краулинговый бюджет — условное количество страниц, которое поисковый робот готов обойти на сайте за отрезок времени. Он не фиксирован и складывается из двух вещей: насколько быстро отвечает сервер и насколько интересен роботу сайт. Когда бюджет тратится на мусорные адреса, до нужных страниц робот просто не доходит.

Для сайта на пятьдесят страниц тема неактуальна: его обойдут целиком в любом случае. Проблема начинается на каталогах, фильтрах и больших блогах — там бюджет можно израсходовать на тысячи бессмысленных адресов.

Из чего он складывается

СоставляющаяЧто означаетЧем управляется
Скорость обходасколько запросов робот может сделать, не мешая сайтускорость ответа сервера, ошибки, настройка в Вебмастере
Потребность в обходенасколько роботу интересно возвращатьсячастота обновлений, спрос на страницы, внутренние ссылки

Отсюда два способа влиять: ускорять сервер и делать так, чтобы обновления были настоящими. Сайт, где ничего не меняется месяцами, робот навещает всё реже — и наоборот.

На что бюджет уходит впустую

  1. Фильтры и сортировки главный пожиратель обхода в магазинах: тысячи адресов с одним и тем же списком товаров. Решается каноническим адресом и Clean-param.
  2. [[dubli-stranic|Дубли]] адреса со слешем и без, с параметрами, с UTM-метками.
  3. Цепочки редиректов каждое звено — отдельный запрос робота. Разбор в статье 301-редирект.
  4. Страницы с ошибками 404 и 500 тоже расходуют обход, особенно если их много и на них есть ссылки.
  5. Пустые и тонкие страницы карточки без описания, теги с одним материалом, пустые разделы.
  6. Медленный сервер при долгих ответах робот снижает скорость обхода сам.

Как экономить

  • Закрыть от обхода служебные разделы — корзину, поиск, личный кабинет: разбор в статье robots.txt.
  • Свести дубли каноническим адресом или редиректом.
  • Убрать цепочки редиректов: внутренние ссылки должны вести сразу на конечный адрес.
  • Держать карту сайта чистой — только живые канонические адреса.
  • Починить массовые 404 и убрать ссылки на них.
  • Ускорить сервер: это единственная мера, которая действительно увеличивает бюджет.

Обратите внимание: robots.txt экономит обход, но не убирает страницы из индекса. Это разные задачи, и путать их — частая ошибка, из-за которой страницы застревают в поиске навсегда.

Кому это вообще важно

Google прямо говорил, что для большинства сайтов краулинговый бюджет не проблема: если страниц меньше нескольких тысяч, они будут обойдены. Реальные сложности начинаются у интернет-магазинов с фильтрами, агрегаторов, больших медиа и сайтов с автоматически генерируемыми разделами.

Если на вашем сайте тридцать страниц, а в поиск попадает десять, дело почти наверняка в качестве этих страниц — смотреть нужно индексацию и статусы в Вебмастере.

Частые вопросы

Как узнать свой краулинговый бюджет?

Точного числа никто не показывает. Ближайшее приближение — отчёт «Статистика обхода» в Яндекс.Вебмастере и «Статистика сканирования» в Search Console: там видно, сколько страниц робот загружает в день и с какими кодами ответа.

Можно ли увеличить бюджет обхода?

Отчасти: ускорение сервера и регулярные настоящие обновления повышают и скорость, и потребность в обходе. Всё остальное — перераспределение: перестать тратить обход на мусор.

Помогает ли закрытие страниц в robots.txt?

Да, для экономии обхода это рабочий инструмент. Но помните, что уже проиндексированные страницы так не удаляются — робот перестанет заходить и не увидит запрет на индексацию.

Может ли сайт просесть в выдаче из-за нехватки обхода?

Напрямую нет. Косвенно да: страница, до которой робот не дошёл, не попадёт в индекс и ранжироваться не будет вовсе. Это влияние идёт через доступность страниц.

Что читать дальше

Дальше практика

Посмотрим, куда уходит обход вашего сайта

Сверим статистику обхода в Вебмастере с тем, что реально попадает в индекс.