Техническая база сайта

Дубли страниц: откуда берутся копии и чем они вредят

Ещё говорят: дублирование контента, дубли контента, копии страниц

Коротко

Дубли — несколько адресов, по которым открывается одинаковое или почти одинаковое содержимое. Поисковик выбирает из них один и показывает в выдаче только его, а остальные исключает. Проблема в том, что выбирает он сам и не всегда ту страницу, которую вы продвигали.

Санкций за дубли внутри сайта обычно нет — есть размывание: сигналы делятся между копиями, а обход тратится на страницы, которые никому не нужны.

Копии создаёт движок

Почти всегда дубли создаёт сам сайт: движок, фильтры и настройки сервера. Восемь типовых источников:

ИсточникКак выглядит
Слеш в конце/uslugi и /uslugi/
www и без wwwsite.ru и www.site.ru
Протоколhttp:// и https://
Главная в двух видах/ и /index.php
Параметры/uslugi/?sort=price, адреса с UTM-метками
Фильтры и сортировкидесятки адресов с одним и тем же списком товаров
Пагинациявторая страница списка почти не отличается от первой
Один товар в разных разделах/katalog/a/tovar/ и /katalog/b/tovar/

Отдельная история — частичные дубли: разные адреса с почти одинаковым текстом. Классика — карточки услуг, где менялось только название города, и страницы товаров с описанием от производителя.

Чем они реально вредят

  1. Поиск выбирает не ту страницу в выдаче оказывается адрес с фильтром вместо вычищенной посадочной.
  2. Сигналы делятся внешние ссылки и поведение распределяются между копиями вместо того, чтобы усиливать одну.
  3. Тратится обход робот ходит по сотням почти одинаковых адресов вместо новых страниц — это прямо бьёт по индексации.
  4. Позиции скачут поисковик периодически меняет выбранный адрес, и график позиций выглядит рвано без всякой причины.

Как найти

  • Вебмастер → Страницы в поиске → Исключённые. Статус «дубль» проставляется прямо, с указанием выбранного адреса.
  • Search Console → Индексирование страниц. Причины «Страница является копией» и «Google выбрал другую каноническую страницу».
  • Ручная проверка адресов. Открыть главную со слешем и без, с www и без, через http — все варианты должны вести на один адрес.
  • Краулер сайта. Сканирование показывает совпадающие заголовки и описания — обычно это первый признак.
  • Поиск одинаковых Title. Если у пятидесяти страниц один Title, там почти наверняка дубли.

Чем убирать

ИнструментКогда применятьЧто делает
301-редиректдубль не нужен людям: www, http, слешсклеивает адреса намертво, передаёт вес
rel="canonical"дубль нужен людям: фильтры, сортировкиуказывает главный адрес, страница остаётся доступной
noindexстраница нужна, но в поиске не нужнаубирает из индекса при открытом обходе
Clean-param в robots.txtпараметры, не меняющие содержимоеЯндекс склеивает адреса по параметрам

Чего делать не стоит: закрывать дубли в robots.txt. Робот перестанет заходить, не увидит canonical и не поймёт, что адреса связаны, — склейки не произойдёт.

Частичные дубли: отдельный разговор

С техническими дублями всё решается настройкой. С текстовыми — только содержанием. Если страницы для двадцати городов отличаются одним словом, склеивать их нельзя (они нужны под разные запросы), а оставлять как есть бессмысленно: поиск выберет одну и покажет только её.

Рабочий выход один: делать страницы действительно разными — свои цены, свои примеры, свои условия. Там, где различий не набирается, честнее свести несколько страниц в одну сильную.

Четыре адреса, с которых начинается проверка

  • Главная со слешем и без ведёт на один адрес.
  • Версия с www перенаправляется на основную.
  • Протокол http уходит на https одним переходом.
  • Адрес с index.php или index.html не открывается напрямую.

Частые вопросы

Дубли — это санкции?

Внутри сайта обычно нет: поисковик просто выбирает один адрес, а остальные исключает. Санкции возможны, если содержимое скопировано с чужих сайтов в больших объёмах — это уже другая история.

Что лучше — 301 или canonical?

Редирект, если дубль не нужен посетителю: он жёстко склеивает адреса. Canonical, если страница нужна людям — фильтр, сортировка, версия для печати. Canonical при этом рекомендация, и поисковик вправе её не послушать.

Нужно ли закрывать пагинацию от индексации?

Чаще нет: вторые и третьи страницы списка помогают роботу дойти до товаров. Закрывать их в robots.txt вредно. Достаточно уникальных Title и canonical каждой страницы на саму себя.

Сколько ждать после склейки дублей?

Робот должен переобойти все адреса, поэтому от пары недель до месяца-двух на большом сайте. Ускорить можно отправкой на переобход и через IndexNow, но мгновенного эффекта не будет.

Что читать дальше

301-редирект 301-редирект — ответ сервера «страница переехала навсегда», после которого браузер и робот идут на новый адрес. Поисковик со… Открыть Индексация сайта Индексация — включение страницы в базу поисковой системы, после которого она может показываться в выдаче. Процесс из трёх шагов… Открыть sitemap.xml sitemap.xml — файл со списком адресов сайта, которые владелец хочет отдать в поиск. Робот использует его как подсказку: откуда… Открыть rel=canonical rel="canonical" — тег в коде страницы, который указывает поисковику основной адрес среди нескольких похожих. Страница при этом… Открыть Краулинговый бюджет Краулинговый бюджет — условное количество страниц, которое поисковый робот готов обойти на сайте за отрезок времени. Он не… Открыть Кластеризация запросов Кластеризация — разбивка собранных запросов на группы, каждая из которых продвигается одной страницей. Основной метод — по… Открыть
Дальше практика

Найдём копии, которые делят ваши позиции

Проверим адреса, склейки и канонические ссылки — и покажем, какие страницы конкурируют сами с собой.