Дубли — это когда одно и то же содержимое открывается по нескольким адресам. Поисковая система видит 2–3 копии одной страницы, выбирает из них одну на своё усмотрение, а остальные исключает. Неприятно тут не само наличие копии, а то, что выбор делает не владелец сайта: в поиске может остаться адрес с меткой рекламной кампании, а не чистый.
Появляются дубли почти всегда сами, без чьего-либо участия: их плодит движок сайта, фильтры в каталоге, метки из рекламы и настройки сервера. Поэтому чистить их разово бесполезно. Нужно понять, какой механизм их создаёт, и поставить правило на уровне шаблона, иначе после ближайшего обновления сайта копии появятся снова.
Откуда берутся дубли на обычном сайте#
Первый источник — зеркала. Сайт открывается с www и без, по http и по https, со слэшем на конце адреса и без него, с окончанием вида /index.php и без. Каждое сочетание даёт отдельный адрес с тем же содержимым, и на одну только главную их набирается до 8 штук.
Второй — параметры в адресе. Метки рекламных кампаний, идентификаторы сессий, сортировка каталога по цене, фильтры по цвету и размеру дописываются к адресу после вопросительного знака и создают новый адрес с прежним содержимым. У магазина такие копии считаются тысячами.
Третий — устройство движка. Карточка товара, лежащая в 2 категориях, часто открывается сразу по 2 путям, а блог добавляет к этому теги, архивы по датам и страницы автора: содержимое одно, обёртки разные. Четвёртый — служебные страницы: версия для печати, результаты внутреннего поиска, страницы-листалки с повторяющимся описанием раздела.
Пятый источник замечают реже всего — полудубли. Это страницы, где отличается название города, одно слово в заголовке или порядок абзацев, а смысл и структура совпадают. Формально текст уникален, для поиска это одна и та же страница, и в выдачу пробивается только одна из них.
Как найти дубли на своём сайте за вечер#
Начните с зеркал. Откройте главную в 4 вариантах: с www и без, со слэшем на конце и без. Каждый вариант должен вести переадресацией на один основной адрес. Если все 4 открываются самостоятельно и в строке браузера остаётся то, что вы набрали, склейки нет и это первое, что нужно чинить.
Дальше посмотрите, что уже попало в индекс. Оператор site: в поисковой строке показывает известные системе адреса вашего сайта. Пролистайте список и обратите внимание на адреса с вопросительным знаком, на повторяющиеся заголовки и на страницы, о существовании которых вы не знали.
Третий шаг — панель вебмастера. Там есть отчёт по страницам, исключённым из поиска, и у части из них причина указана прямо: копия другой страницы. Это самый честный список, потому что его составляет сама поисковая система, а не ваши предположения о том, как она устроена.
Четвёртый шаг — прогнать сайт краулером и отсортировать выгрузку по заголовкам. Одинаковый заголовок почти всегда означает одинаковую страницу, поэтому пары находятся за минуту. Как заполнять их так, чтобы совпадений не было, разбираем в материале про title и description.
Чем закрывать: канонический адрес и редирект#
Инструментов 3, и путать их не стоит. Постоянная переадресация склеивает адреса намертво. Указание канонического адреса подсказывает поиску, какую копию считать основной, но оставляет остальные доступными. Запрет индексации убирает страницу из поиска, не трогая её для посетителей.
Критерий выбора простой. Если адрес людям не нужен — зеркала, слэш, старые адреса после переезда — ставится переадресация. Если адрес нужен посетителю, но в поиске не нужен — сортировка, фильтр, метка кампании — ставится канонический адрес на чистую версию. Если страница нужна людям, а поиску вредна — печать, внутренний поиск, корзина — ставится запрет индексации.
Отдельно стоит убрать параметры из обхода. В файле robots.txt для Яндекса есть директива Clean-param: она говорит не считать перечисленные параметры частью адреса. Работает аккуратнее полного запрета — страница остаётся в обходе, а копии с метками схлопываются в одну.
И проверьте карту сайта. В неё должны попадать только основные адреса. Карта, где рядом лежат чистый адрес и он же с параметром сортировки, отправляет поисковой системе противоречивый сигнал и обесценивает всю остальную настройку, сколько бы времени на неё ни ушло.
Частые ошибки при закрытии дублей#
Первая по частоте — канонический адрес всех страниц указывает на главную. Так иногда настраивают шаблон «чтобы наверняка», и через месяц каталог целиком выпадает из поиска. Правило одно: обычная страница указывает канонический адрес сама на себя, копия — на оригинал.
Вторая ошибка — закрыть дубли запретом в robots.txt и на этом успокоиться. Робот не заходит на закрытый адрес, значит, не видит ни канонического указания, ни переадресации, и склейка не происходит. Запрет и склейка одновременно на одном адресе работают друг против друга.
Третья — цепочки переадресаций. Старый адрес ведёт на промежуточный, тот на третий, и только потом на рабочий. Каждое звено съедает часть эффекта и замедляет обход. Цепочку нужно спрямлять до одного шага, даже если она сложилась исторически за несколько переездов сайта.
Четвёртая — внутренние ссылки, ведущие на неканонические адреса. Сайт сам ссылается на версии с метками и параметрами, и поиск получает подтверждение, что важен именно такой адрес. Как выстроить ссылки внутри сайта, разбираем в материале про внутреннюю перелинковку.
Вывод: дубли лечатся правилом, а не разово#
Дубли — не разовая поломка, а постоянный фон работы сайта. Движок, реклама и правки в каталоге создают новые копии сами, поэтому смысл имеет не чистка списка, а правило в шаблоне: каждая страница знает свой основной адрес, каждый лишний вариант ведёт на него переадресацией.
Минимальный порядок для небольшого сайта выглядит так. Один основной адрес и переадресация на него со всех зеркал. Канонический адрес в шаблоне на каждой странице. Запрет индексации на служебных разделах. Параметры выведены из обхода. Внутренние ссылки и карта сайта ведут только на основные адреса.
Проверять эти 5 пунктов достаточно после каждого крупного обновления сайта и раз в квартал в спокойном режиме. Отдельно держите в голове полудубли: две страницы под один и тот же запрос техникой не разводятся, их либо объединяют в одну, либо переписывают под разные задачи читателя.