Краулинговый бюджет: почему робот не доходит до половины сайта
Ещё говорят: бюджет обхода, crawl budget, лимит обхода
Краулинговый бюджет — условное количество страниц, которое поисковый робот готов обойти на сайте за отрезок времени. Он не фиксирован и складывается из двух вещей: насколько быстро отвечает сервер и насколько интересен роботу сайт. Когда бюджет тратится на мусорные адреса, до нужных страниц робот просто не доходит.
Для сайта на пятьдесят страниц тема неактуальна: его обойдут целиком в любом случае. Проблема начинается на каталогах, фильтрах и больших блогах — там бюджет можно израсходовать на тысячи бессмысленных адресов.
Из чего он складывается
| Составляющая | Что означает | Чем управляется |
|---|---|---|
| Скорость обхода | сколько запросов робот может сделать, не мешая сайту | скорость ответа сервера, ошибки, настройка в Вебмастере |
| Потребность в обходе | насколько роботу интересно возвращаться | частота обновлений, спрос на страницы, внутренние ссылки |
Отсюда два способа влиять: ускорять сервер и делать так, чтобы обновления были настоящими. Сайт, где ничего не меняется месяцами, робот навещает всё реже — и наоборот.
На что бюджет уходит впустую
-
Фильтры и сортировки
главный пожиратель обхода в магазинах: тысячи адресов с одним и тем же списком товаров. Решается каноническим адресом и
Clean-param. - [[dubli-stranic|Дубли]] адреса со слешем и без, с параметрами, с UTM-метками.
- Цепочки редиректов каждое звено — отдельный запрос робота. Разбор в статье 301-редирект.
- Страницы с ошибками 404 и 500 тоже расходуют обход, особенно если их много и на них есть ссылки.
- Пустые и тонкие страницы карточки без описания, теги с одним материалом, пустые разделы.
- Медленный сервер при долгих ответах робот снижает скорость обхода сам.
Как экономить
- Закрыть от обхода служебные разделы — корзину, поиск, личный кабинет: разбор в статье robots.txt.
- Свести дубли каноническим адресом или редиректом.
- Убрать цепочки редиректов: внутренние ссылки должны вести сразу на конечный адрес.
- Держать карту сайта чистой — только живые канонические адреса.
- Починить массовые 404 и убрать ссылки на них.
- Ускорить сервер: это единственная мера, которая действительно увеличивает бюджет.
Обратите внимание: robots.txt экономит обход, но не убирает страницы из индекса. Это разные задачи, и путать их — частая ошибка, из-за которой страницы застревают в поиске навсегда.
Кому это вообще важно
Google прямо говорил, что для большинства сайтов краулинговый бюджет не проблема: если страниц меньше нескольких тысяч, они будут обойдены. Реальные сложности начинаются у интернет-магазинов с фильтрами, агрегаторов, больших медиа и сайтов с автоматически генерируемыми разделами.
Если на вашем сайте тридцать страниц, а в поиск попадает десять, дело почти наверняка в качестве этих страниц — смотреть нужно индексацию и статусы в Вебмастере.
Частые вопросы
Как узнать свой краулинговый бюджет?
Точного числа никто не показывает. Ближайшее приближение — отчёт «Статистика обхода» в Яндекс.Вебмастере и «Статистика сканирования» в Search Console: там видно, сколько страниц робот загружает в день и с какими кодами ответа.
Можно ли увеличить бюджет обхода?
Отчасти: ускорение сервера и регулярные настоящие обновления повышают и скорость, и потребность в обходе. Всё остальное — перераспределение: перестать тратить обход на мусор.
Помогает ли закрытие страниц в robots.txt?
Да, для экономии обхода это рабочий инструмент. Но помните, что уже проиндексированные страницы так не удаляются — робот перестанет заходить и не увидит запрет на индексацию.
Может ли сайт просесть в выдаче из-за нехватки обхода?
Напрямую нет. Косвенно да: страница, до которой робот не дошёл, не попадёт в индекс и ранжироваться не будет вовсе. Это влияние идёт через доступность страниц.