Гайды

Что такое robots.txt и зачем он нужен: полное руководство

Что такое robots.txt и зачем он нужен: полное руководство

Robots.txt — крошечный текстовый файл, который лежит в корне вашего сайта. Его задача — сказать поисковому роботу: «Вот сюда заходи, а вот сюда — не надо.» Файл весит пару килобайт, но одна ошибка в нём может полностью удалить сайт из Google. Без преувеличений — я видел такое не раз.

Что происходит, когда робот заходит на сайт

Робот Google или Яндекса первым делом обращается к адресу yoursite.com/robots.txt. Там он читает правила: какие разделы можно сканировать, какие нельзя, и где лежит карта сайта. Только после этого начинает обходить страницы.

Вот как выглядит типичный robots.txt:

User-agent: *
Allow: /
Disallow: /admin/
Disallow: /cart/
Sitemap: https://yoursite.com/sitemap.xml

Тут всё просто: звёздочка — правило для всех роботов. Слэш после Allow — разрешение сканировать весь сайт. Disallow закрывает конкретные разделы. Sitemap подсказывает, где найти полный список страниц.

Какие страницы прятать от поисковиков

На любом сайте есть страницы, которым в поисковой выдаче делать нечего:

  • Админка (/admin/, /wp-admin/) — мало того что бесполезна в поиске, так ещё и лишнее внимание к ней ни к чему
  • Корзина и оформление заказа (/cart/, /checkout/) — создают дубли контента
  • Страницы фильтров (/catalog?color=red&size=xl) — каждая комбинация фильтров порождает новый URL, а это тысячи мусорных страниц
  • Внутренний поиск (/search?q=...) — бесконечное число страниц с разными запросами
  • Служебные разделы (/login/, /register/, /api/) — не несут ценности для поисковика

Готовые шаблоны для популярных CMS

Для WordPress:

User-agent: *
Allow: /
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-content/plugins/
Disallow: /?s=
Sitemap: https://yoursite.com/sitemap.xml

Для Next.js (на нём работает наш сайт):

User-agent: *
Allow: /
Disallow: /api/
Disallow: /_next/
Sitemap: https://yoursite.com/sitemap.xml

Четыре ошибки, которые ломают SEO

Disallow: / (закрыть весь сайт). Одна строчка — и сайт исчезает из поиска. Самое страшное, что это может произойти случайно: разработчик закрыл сайт на время тестирования и забыл открыть. Я лично видел случай, когда интернет-магазин в Минске терял 3000 визитов в день три недели подряд, пока кто-то не догадался проверить robots.txt.

Файла нет вообще. Не критично, но неоптимально — робот будет сканировать всё подряд, включая мусорные страницы. Создать robots.txt — дело пяти минут, нет причин этого не делать.

Закрыть CSS и JavaScript. Google рендерит страницы как браузер — ему нужны стили и скрипты, чтобы оценить, как сайт выглядит на мобильном. Заблокируете их — Google не сможет проверить адаптивность.

Путать Disallow с запретом индексации. Тонкий момент: robots.txt запрещает сканирование, но не индексацию. Если на закрытую страницу ведут внешние ссылки, Google может её проиндексировать, просто не заходя на неё. Для полного запрета индексации используйте мета-тег noindex в HTML-коде страницы.

Как убедиться, что всё настроено правильно

  1. Откройте yoursite.com/robots.txt прямо в браузере — файл должен быть виден
  2. В Google Search Console есть инструмент проверки robots.txt — он подсветит ошибки
  3. В Яндекс Вебмастере — раздел «Анализ robots.txt», проверит корректность по правилам Яндекса

Взяли за правило: после каждого обновления сайта, после смены CMS, после переезда на новый домен — проверьте robots.txt. Пять минут проверки могут спасти месяцы позиций.

На наших проектах robots.txt и техническая база настроены с первого дня. Например, у СпецГидроТех за 2 месяца поисковики корректно проиндексировали 1065 страниц каталога — 55% трафика пришло из органического поиска.

Хотите такой же результат?

Бесплатный SEO-аудит вашего сайта за 24 часа

Получить аудит