Дубли страниц: откуда берутся копии и чем они вредят
Ещё говорят: дублирование контента, дубли контента, копии страниц
Дубли — несколько адресов, по которым открывается одинаковое или почти одинаковое содержимое. Поисковик выбирает из них один и показывает в выдаче только его, а остальные исключает. Проблема в том, что выбирает он сам и не всегда ту страницу, которую вы продвигали.
Санкций за дубли внутри сайта обычно нет — есть размывание: сигналы делятся между копиями, а обход тратится на страницы, которые никому не нужны.
Копии создаёт движок
Почти всегда дубли создаёт сам сайт: движок, фильтры и настройки сервера. Восемь типовых источников:
| Источник | Как выглядит |
|---|---|
| Слеш в конце | /uslugi и /uslugi/ |
| www и без www | site.ru и www.site.ru |
| Протокол | http:// и https:// |
| Главная в двух видах | / и /index.php |
| Параметры | /uslugi/?sort=price, адреса с UTM-метками |
| Фильтры и сортировки | десятки адресов с одним и тем же списком товаров |
| Пагинация | вторая страница списка почти не отличается от первой |
| Один товар в разных разделах | /katalog/a/tovar/ и /katalog/b/tovar/ |
Отдельная история — частичные дубли: разные адреса с почти одинаковым текстом. Классика — карточки услуг, где менялось только название города, и страницы товаров с описанием от производителя.
Чем они реально вредят
- Поиск выбирает не ту страницу в выдаче оказывается адрес с фильтром вместо вычищенной посадочной.
- Сигналы делятся внешние ссылки и поведение распределяются между копиями вместо того, чтобы усиливать одну.
- Тратится обход робот ходит по сотням почти одинаковых адресов вместо новых страниц — это прямо бьёт по индексации.
- Позиции скачут поисковик периодически меняет выбранный адрес, и график позиций выглядит рвано без всякой причины.
Как найти
- Вебмастер → Страницы в поиске → Исключённые. Статус «дубль» проставляется прямо, с указанием выбранного адреса.
- Search Console → Индексирование страниц. Причины «Страница является копией» и «Google выбрал другую каноническую страницу».
- Ручная проверка адресов. Открыть главную со слешем и без, с www и без, через http — все варианты должны вести на один адрес.
- Краулер сайта. Сканирование показывает совпадающие заголовки и описания — обычно это первый признак.
- Поиск одинаковых Title. Если у пятидесяти страниц один Title, там почти наверняка дубли.
Чем убирать
| Инструмент | Когда применять | Что делает |
|---|---|---|
| 301-редирект | дубль не нужен людям: www, http, слеш | склеивает адреса намертво, передаёт вес |
rel="canonical" | дубль нужен людям: фильтры, сортировки | указывает главный адрес, страница остаётся доступной |
noindex | страница нужна, но в поиске не нужна | убирает из индекса при открытом обходе |
Clean-param в robots.txt | параметры, не меняющие содержимое | Яндекс склеивает адреса по параметрам |
Чего делать не стоит: закрывать дубли в robots.txt. Робот перестанет заходить, не увидит canonical и не поймёт, что адреса связаны, — склейки не произойдёт.
Частичные дубли: отдельный разговор
С техническими дублями всё решается настройкой. С текстовыми — только содержанием. Если страницы для двадцати городов отличаются одним словом, склеивать их нельзя (они нужны под разные запросы), а оставлять как есть бессмысленно: поиск выберет одну и покажет только её.
Рабочий выход один: делать страницы действительно разными — свои цены, свои примеры, свои условия. Там, где различий не набирается, честнее свести несколько страниц в одну сильную.
Четыре адреса, с которых начинается проверка
- Главная со слешем и без ведёт на один адрес.
- Версия с www перенаправляется на основную.
- Протокол http уходит на https одним переходом.
-
Адрес с
index.phpилиindex.htmlне открывается напрямую.
Частые вопросы
Дубли — это санкции?
Внутри сайта обычно нет: поисковик просто выбирает один адрес, а остальные исключает. Санкции возможны, если содержимое скопировано с чужих сайтов в больших объёмах — это уже другая история.
Что лучше — 301 или canonical?
Редирект, если дубль не нужен посетителю: он жёстко склеивает адреса. Canonical, если страница нужна людям — фильтр, сортировка, версия для печати. Canonical при этом рекомендация, и поисковик вправе её не послушать.
Нужно ли закрывать пагинацию от индексации?
Чаще нет: вторые и третьи страницы списка помогают роботу дойти до товаров. Закрывать их в robots.txt вредно. Достаточно уникальных Title и canonical каждой страницы на саму себя.
Сколько ждать после склейки дублей?
Робот должен переобойти все адреса, поэтому от пары недель до месяца-двух на большом сайте. Ускорить можно отправкой на переобход и через IndexNow, но мгновенного эффекта не будет.