Техническая база сайта

robots.txt: что это за файл и как им не закрыть сайт целиком

Ещё говорят: robots txt, файл robots, директивы robots

Коротко

robots.txt — текстовый файл в корне сайта, который говорит поисковым роботам, какие разделы обходить, а какие нет. Это рекомендация, а не запрет доступа: файл управляет обходом, но не скрывает страницу от людей и не гарантирует, что её не окажется в выдаче. Формат одинаковый для Яндекса и Google, отдельные директивы различаются.

Самая дорогая ошибка в SEO живёт именно здесь: строка Disallow: / закрывает от обхода весь сайт целиком, и обнаруживается это обычно через месяц по упавшему трафику.

Что он делает и чего не делает

ДелаетНе делает
Просит робота не обходить разделНе закрывает страницу от людей — она открыта по прямой ссылке
Экономит обход на служебных адресахНе гарантирует отсутствия в выдаче: адрес может попасть туда по внешним ссылкам
Указывает адрес карты сайтаНе удаляет уже проиндексированное — для этого нужен noindex или удаление страницы
Работает для послушных роботовНе защищает от сканеров, которые правила игнорируют

Отсюда важное следствие: чтобы убрать страницу из поиска, закрывать её в robots.txt бесполезно и даже вредно — робот перестанет заходить и не увидит noindex. Разница между обходом и индексацией тут решает всё.

Из чего состоит файл

  • User-agent: — для какого робота правила. * — для всех, Yandex и Googlebot — для конкретных.
  • Disallow: — что не обходить. Пустое значение разрешает всё.
  • Allow: — исключение внутри закрытого раздела.
  • Sitemap: — полный адрес карты сайта. Указывается один раз, вне блоков.
  • Clean-param: — директива Яндекса: какие параметры в адресе не влияют на содержимое.

Директива Crawl-delay устарела: Яндекс перестал её учитывать, скорость обхода настраивается в Вебмастере. Host тоже больше не нужна — главное зеркало определяется редиректами.

Рабочий скелет для сайта на WordPress
User-agent: *
Disallow: /wp-admin/
Disallow: /*?s=
Disallow: /cart/
Disallow: /*?add-to-cart=
Allow: /wp-admin/admin-ajax.php

Clean-param: utm_source&utm_medium&utm_campaign&yclid&gclid

Sitemap: https://site.ru/sitemap.xml

Ошибки, которые встречаются чаще всего

  1. Закрыт весь сайт Disallow: / уезжает с тестового сервера на боевой вместе с остальными файлами. Проверять первым делом после каждого переезда.
  2. Закрыты скрипты и стили робот видит страницу без оформления и считает её неудобной для мобильных. Папки с CSS и JS закрывать нельзя.
  3. Страница закрыта, но нужна в поиске частый случай с разделами фильтров, под которые есть спрос.
  4. Закрытием пытаются убрать из индекса не работает: нужен noindex при открытом обходе.
  5. Забыли `Sitemap:` робот найдёт карту и сам, но медленнее.
  6. Файл отдаёт 404 или редирект в этом случае ограничений нет вовсе — обходится всё подряд.

Краулеры нейросетей

Модели обходят сайты своими роботами: GPTBot у OpenAI, ClaudeBot у Anthropic, PerplexityBot, Google-Extended и другие. Их тоже можно закрыть в robots.txt — и здесь стоит подумать дважды.

Если всё-таки нужно закрыть
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: PerplexityBot
Disallow: /

Для большинства компаний такой запрет вреден: он убирает ваш сайт из источников ответа, но не убирает конкурентов и не мешает пересказывать вас по чужим публикациям. Смысл появляется, когда контент — сам товар: платная база, курс, уникальная методика. Подробнее про механику — в статьях AI-поиск и GEO-оптимизация.

Как проверить

  • Открыть site.ru/robots.txt в браузере — файл должен отдаваться текстом и кодом 200.
  • Прогнать список адресов через анализатор robots.txt в Яндекс.Вебмастере.
  • Сверить с отчётом «Страницы в поиске»: если нужные разделы помечены как исключённые по robots.txt, причина найдена.

Частые вопросы

Обязателен ли robots.txt?

Формально нет: без него обходится всё подряд, и для маленького сайта это иногда даже нормально. Практически файл нужен — хотя бы чтобы закрыть служебные адреса и указать карту сайта.

Как убрать страницу из поиска?

Метатегом noindex при открытом для робота обходе, либо удалением страницы с ответом 404 или 410. Закрытие в robots.txt для этого не подходит: робот перестанет заходить и не увидит запрет.

Нужны ли отдельные правила для Яндекса и Google?

Обычно нет: хватает блока User-agent: *. Отдельный блок для Яндекса имеет смысл ради Clean-param, которую Google не понимает.

Что будет, если закрыть сайт целиком?

Обход прекратится, страницы начнут выпадать из индекса, трафик упадёт. Восстановление занимает недели: сначала переобход, потом возврат в выдачу. Поэтому robots.txt проверяют сразу после каждой выкатки.

Что читать дальше

Индексация сайта Индексация — включение страницы в базу поисковой системы, после которого она может показываться в выдаче. Процесс из трёх шагов… Открыть llms.txt llms.txt — текстовый файл в корне сайта, который в сжатом виде рассказывает языковым моделям, что это за сайт и какие страницы на… Открыть AI-поиск AI-поиск — режим, в котором поисковик отвечает сам: нейросеть собирает готовый ответ по нескольким источникам и показывает его… Открыть sitemap.xml sitemap.xml — файл со списком адресов сайта, которые владелец хочет отдать в поиск. Робот использует его как подсказку: откуда… Открыть Краулинговый бюджет Краулинговый бюджет — условное количество страниц, которое поисковый робот готов обойти на сайте за отрезок времени. Он не… Открыть UTM-метки UTM-метки — параметры, дописанные к адресу ссылки после знака вопроса. Страницу они не меняют и сообщают аналитике, откуда пришёл… Открыть
Дальше практика

Проверим, что у вас закрыто от поиска

Посмотрим robots.txt, карту сайта и статусы в Вебмастере — и скажем, какие страницы не доходят до индекса и почему.