Caseproof

SEO и поисковый трафик Гайд

Файл robots.txt: как работает и что в нём писать

robots.txt управляет обходом сайта поисковыми роботами: где лежит файл, из каких директив состоит, что в нём закрывать, а что трогать нельзя, и как проверить результат.

Редакционный профиль раздела «SEO»

robots.txt — текстовый файл в корне сайта, который сообщает поисковым роботам, какие адреса обходить не нужно. Робот запрашивает его первым, до всех остальных страниц, и дальше действует по написанным там правилам. Файл управляет обходом, а не выдачей: он экономит ресурс робота на служебных разделах, но не гарантирует, что закрытая страница не окажется в поиске.

Настраивают его один раз, и живёт он потом годами, поэтому большинство проблем с ним — наследство: запрет, поставленный на этапе разработки, или строка, скопированная из чужого шаблона. Проверить свой файл можно за 2 минуты: он открывается по адресу вида site.ru/robots.txt и читается глазами, без специальных программ.

Что такое robots.txt и где он лежит#

Технически это обычный текстовый файл в кодировке UTF-8, который лежит в корне сайта и открывается по адресу вида site.ru/robots.txt. Другого места у него нет: файл, положенный в подпапку, робот не найдёт и искать не станет. Имя пишется строчными буквами, без вариантов вроде Robots.TXT.

Действует файл на один хост. Для поддомена нужен отдельный robots.txt, и правила основного сайта на него не распространяются. Протокол тоже учитывается: после переезда на https файл должен открываться именно по защищённому адресу, иначе робот прочитает пустоту.

Важен ответ сервера. Нормально, когда файла нет вовсе: робот получает ошибку 404 и считает, что обходить можно всё. Хуже, если адрес отдаёт ошибку сервера — тогда поисковая система может временно счесть закрытым весь сайт и приостановить обход до восстановления доступа.

Размер файла тоже имеет значение. У робота есть предел, выше которого файл читается не целиком: хвост отбрасывается, и правила из него молча перестают работать — файл при этом открывается и выглядит нормальным. Точную величину предела смотрят в справке той поисковой системы, под которую вы настраиваете сайт, потому что у разных роботов она своя и со временем меняется. Для малого бизнеса это не проблема — рабочий файл занимает от силы пару десятков строк. Раздувается он обычно от попытки перечислить каждый служебный адрес поштучно, а этого делать не нужно: для того и придуманы маски и правила по началу пути, чтобы одна строка закрывала целую группу адресов.

Из каких директив состоит файл#

Строки группируются по роботам. Блок начинается с User-agent — имени робота, к которому относятся правила; звёздочка на этом месте означает «для всех». Дальше идут запреты и разрешения, а группа заканчивается пустой строкой перед следующим User-agent.

Disallow закрывает адреса, начинающиеся с указанного пути. Запись «Disallow: /cart» закроет и корзину, и вложенные адреса вроде /cart/step-2. Пустое значение после двоеточия не запрещает ничего, а одинокий слэш закрывает сайт целиком — именно эта строка чаще всего остаётся с этапа разработки.

Allow работает наоборот и нужен, чтобы вернуть роботу доступ к части закрытого раздела. При конфликте побеждает более конкретное правило: длинный путь важнее короткого, при равной длине — разрешение. В путях работают 2 спецсимвола: звёздочка заменяет любую последовательность знаков, доллар обозначает конец адреса. Регистр важен: /Catalog и /catalog — разные адреса.

Отдельно стоит строка Sitemap с полным адресом карты сайта, вместе с протоколом. Она не привязана к блокам и пишется один раз. Набор директив, которые робот вообще принимает во внимание, со временем меняется, и часть строк кочует из старых шаблонов уже по инерции. Поэтому незнакомую строку перед тем, как оставить её в файле, сверяют со справкой своей поисковой системы: если директива не поддерживается, она просто мусор, а если поддерживается — стоит понимать, что именно вы ей включаете. Настройки скорости обхода тоже ищите в панели вебмастера, а не в файле.

Что закрывать, а что трогать не нужно#

Закрывать имеет смысл то, что не должно тратить время робота и бесполезно для человека из поиска: корзину, оформление заказа, личный кабинет, административную часть, страницы внутреннего поиска по сайту, служебные адреса форм и сравнения товаров. Клиентов они не приводят.

Отдельная история — фильтры каталога. Комбинации параметров порождают тысячи почти одинаковых адресов, и робот уходит туда вместо обхода карточек. Запрет по маске с вопросительным знаком тут оправдан, но сначала проверьте отчёт по посадочным страницам: часть фильтров может уже приносить трафик, и закрывать их себе дороже.

Чего трогать не стоит — папки со стилями, скриптами и изображениями. Робот загружает страницу целиком и оценивает то, что видит пользователь. Закрытые ресурсы превращают аккуратный сайт в поломанный текст без вёрстки, и это отражается на оценке страницы.

Второе исключение — страницы, которые нужно убрать из поиска. Запрет в robots.txt тут не помощник: робот не откроет страницу и не увидит ни noindex, ни канонического адреса, а страница может остаться в выдаче по внешним ссылкам. Порядок разбора таких случаев — в разборе того, почему статья не индексируется.

Частые ошибки и как проверить файл#

Самая дорогая ошибка — строка «Disallow: /», забытая после разработки. Сайт при этом работает и выглядит нормально, но постепенно исчезает из поиска, а заметить это удаётся спустя недели, когда просядут заявки. Поэтому после переноса сайта на боевой домен файл открывают первым.

Вторая по частоте — файл, скопированный у чужого сайта. Правила под другую систему управления закрывают несуществующие папки и заодно что-нибудь нужное. Третья ошибка — попытка закрыть в robots.txt то, что уже в индексе. Запрет не удаляет страницу, а лишь запрещает её перечитывать, поэтому адрес месяцами висит в выдаче без описания.

Четвёртая ошибка тише остальных: закрыт раздел, на который ведут ссылки со всего сайта. Ссылочный вес уходит в тупик, а меню работает вхолостую. Какие ссылки упираются в запрет, видно при аудите — об этом материал про внутреннюю перелинковку.

Проверять недолго. Откройте файл в браузере, затем прогоните через инструмент проверки robots.txt в панели вебмастера 5–10 важных адресов: главную, карточку товара, раздел каталога, статью блога. Такой инструмент есть в панелях основных поисковых систем, и он отвечает не просто «можно или нельзя», а показывает строку, которая сработала, — так вы видите причину, а не только результат. Там же смотрят, какую версию файла робот скачал в последний раз: она может отличаться от той, что лежит на сервере, если правку ещё не перечитали. Делайте это после каждой переделки сайта.

Вывод: robots.txt как гигиена, а не защита#

robots.txt решает узкую задачу: подсказывает роботу, куда не ходить. Он не прячет содержимое от людей, не удаляет страницы из поиска и не поднимает позиции. Всё, что он даёт, — экономию обхода и порядок на служебных адресах, и ждать от него большего смысла нет.

Рабочий минимум для сайта малого бизнеса умещается в несколько строк: один блок User-agent для всех роботов, запреты на корзину, оформление заказа, личный кабинет и внутренний поиск, строка Sitemap с полным адресом карты. Остальное добавляется по конкретному поводу, а не на всякий случай.

Заведите привычку открывать site.ru/robots.txt после каждой переделки сайта и сверять содержимое с тем, что ожидаете там увидеть. 2 минуты раз в квартал дешевле, чем месяц выпадения из поиска из-за одного забытого слэша. Отдельно проверяйте файл после смены подрядчика.

И держите в голове разделение: чтобы страницу не обходили — robots.txt; чтобы страницы не было в поиске — мета-тег noindex при открытом для робота доступе. Перепутанные местами, эти два инструмента дают результат, обратный ожидаемому. На практике путают их чаще всего.

Темы robots txt

Читать ещё

  1. SEO и поисковый трафик

    Продвижение в Яндекс Картах: Software или Cloud

  2. SEO и поисковый трафик

    Программа для накрутки Яндекс Карт: обзор TopPoint

  3. SEO и поисковый трафик

    Накрутка ПФ в Яндекс Картах: как работает TopPoint

  4. SEO и поисковый трафик

    Как проверить SEO-подрядчика до подписания договора