Ранжирование и индексация

Индексация сайта: как страница попадает в поиск и почему не попадает

Ещё говорят: индексирование, попадание в индекс, обход и индексация

Коротко

Индексация — включение страницы в базу поисковой системы, после которого она может показываться в выдаче. Процесс из трёх шагов: робот узнаёт адрес, обходит страницу и принимает решение, брать её в индекс или нет. Последний шаг не гарантирован: обойти — не значит проиндексировать.

Страница вне индекса не участвует ни в обычной выдаче, ни в ответах нейросетей: источники для них берутся из того же индекса.

Путь страницы в поиск

  1. Робот узнаёт адрес из sitemap.xml, из внутренних ссылок, из чужих ссылок или из данных счётчика — в Яндексе это режим «Обход по счётчику Метрики».
  2. Робот приходит на страницу скачивает HTML. Если сервер отвечает ошибкой или думает слишком долго, обход откладывается.
  3. Страница оценивается нет ли запретов, не дубль ли это, есть ли на ней содержимое, ради которого её стоит хранить.
  4. Страница попадает в индекс и только теперь может показываться в выдаче.

Между шагами 3 и 4 и теряется большинство страниц. Они обойдены, но в индекс не взяты, и в Вебмастере получают статус вроде «недостаточно качественная страница».

Почему страница не в индексе

ПричинаГде видноЧто делать
Запрет в robots.txtВебмастер, раздел «Индексирование»убрать директиву, проверить в анализаторе robots.txt
Метатег noindexисходный код страницыубрать тег, повторно отправить на переобход
canonical на другой адресисходный кодисправить канонический адрес
ДублиВебмастер, «Страницы в поиске»склеить редиректом или каноникалом
Пустая или тонкая страницастатус «недостаточно качественная»дописать содержимое или удалить и закрыть 301
Контент только в скриптепросмотр кода без JSотдавать текст в HTML
Сервер отвечает ошибкойлоги, Вебмастерчинить хостинг и коды ответа
Обойти — не значит проиндексировать. Между этими двумя событиями и теряется большинство страниц, за которые владелец сайта уже заплатил.

Как проверить

  • Яндекс.Вебмастер → Индексирование → Страницы в поиске — сколько страниц в индексе и что из них выпало за период.
  • Проверка конкретного URL — в Вебмастере есть отдельный инструмент со статусом и датой последнего обхода.
  • Сравнение с sitemap.xml — сколько адресов в карте против того, сколько в индексе. Разрыв в разы означает системную проблему.
  • Google Search Console — тот же смысл в отчёте «Индексирование страниц».

Оператор site: в строке поиска даёт приблизительное число и для диагностики не годится: он показывает результат обычного поиска по домену.

Как ускорить

  1. Отправить на переобход вручную в Вебмастере есть суточная квота на переобход конкретных адресов — её стоит расходовать на важные страницы.
  2. Включить обход по счётчику Яндекс узнаёт о новых адресах из Метрики, не дожидаясь карты сайта.
  3. Использовать IndexNow протокол мгновенного уведомления поисковиков об изменениях; Яндекс его поддерживает.
  4. Проставить внутренние ссылки страница без входящих ссылок — сирота: робот доходит до неё редко и оценивает хуже.
  5. Ускорить сервер чем быстрее отвечает сайт, тем больше страниц робот успевает обойти за визит.

Индексация и AI-поиск

Нейросети в выдаче не ходят по сайтам сами: они получают документы из поискового индекса — механику разбираем в статье RAG. Значит, страница вне индекса не попадёт и в ответ Нейро. Любая работа над видимостью в нейросетях начинается отсюда.

Частые вопросы

Сколько времени занимает индексация новой страницы?

От нескольких часов до нескольких недель. На молодом сайте без трафика и ссылок дольше, на активном сайте с быстрым сервером — быстрее. Ручная отправка на переобход и IndexNow сокращают ожидание, но не отменяют оценку качества.

Почему страниц в индексе меньше, чем в карте сайта?

Обычно из-за дублей, тонких страниц и служебных адресов, которые незачем индексировать. Разрыв сам по себе не диагноз — смотреть надо, какие именно страницы не дошли и с каким статусом.

Нужно ли закрывать от индексации страницы фильтров и сортировок?

Чаще да: они плодят почти одинаковые адреса и размывают обход. Исключение — фильтры, под которые есть реальный спрос: такие страницы делают посадочными и оставляют открытыми.

Страница выпала из индекса — это санкции?

Почти никогда. В подавляющем большинстве случаев это дубль, тонкий контент или техническая ошибка. Статус в Вебмастере называет причину прямо, и начинать надо с него.

Что читать дальше

Поведенческие факторы Поведенческие факторы (ПФ) — сигналы о том, как люди ведут себя в поисковой выдаче и на самом сайте: выбирают ли ваш сниппет… Открыть Коммерческие факторы Коммерческие факторы — признаки того, что за сайтом стоит настоящая компания, у которой можно купить: цены, контакты, условия… Открыть RAG RAG (Retrieval Augmented Generation, генерация с поиском) — схема работы нейросети, при которой она сначала находит подходящие… Открыть Битые ссылки и 404 Битая ссылка — ссылка на адрес, которого не существует; сервер отвечает кодом 404 «не найдено». Сам по себе ответ 404 нормален и… Открыть Кластеризация запросов Кластеризация — разбивка собранных запросов на группы, каждая из которых продвигается одной страницей. Основной метод — по… Открыть llms.txt llms.txt — текстовый файл в корне сайта, который в сжатом виде рассказывает языковым моделям, что это за сайт и какие страницы на… Открыть Видимость сайта Видимость сайта — сводный показатель охвата поиска: какую долю возможных показов сайт получает по своему списку запросов с учётом… Открыть Внутренняя перелинковка Внутренняя перелинковка — ссылки между страницами одного сайта. Она решает три задачи сразу: показывает роботу, какие страницы… Открыть robots.txt robots.txt — текстовый файл в корне сайта, который говорит поисковым роботам, какие разделы обходить, а какие нет. Это… Открыть Микроразметка Микроразметка — дополнительный слой в коде страницы, который называет её содержимое машинным языком: вот организация, вот цена… Открыть Title и Description Title — заголовок страницы в коде, который поисковик показывает ссылкой в выдаче и выводит во вкладке браузера. Description… Открыть Core Web Vitals Core Web Vitals — набор из трёх показателей Google, которыми измеряют скорость и удобство страницы глазами посетителя: LCP (когда… Открыть sitemap.xml sitemap.xml — файл со списком адресов сайта, которые владелец хочет отдать в поиск. Робот использует его как подсказку: откуда… Открыть Дубли страниц Дубли — несколько адресов, по которым открывается одинаковое или почти одинаковое содержимое. Поисковик выбирает из них один и… Открыть rel=canonical rel="canonical" — тег в коде страницы, который указывает поисковику основной адрес среди нескольких похожих. Страница при этом… Открыть 301-редирект 301-редирект — ответ сервера «страница переехала навсегда», после которого браузер и робот идут на новый адрес. Поисковик со… Открыть Краулинговый бюджет Краулинговый бюджет — условное количество страниц, которое поисковый робот готов обойти на сайте за отрезок времени. Он не… Открыть UTM-метки UTM-метки — параметры, дописанные к адресу ссылки после знака вопроса. Страницу они не меняют и сообщают аналитике, откуда пришёл… Открыть Региональность сайта Региональность — город или область, к которым поисковик относит сайт. От неё зависит, попадёт ли сайт в выдачу по геозависимым… Открыть
Дальше практика

Проверим, что из вашего сайта реально в поиске

Сверим карту сайта с индексом Яндекса и покажем, какие страницы не дошли и почему.