Что такое robots.txt и зачем он нужен: полное руководство

Robots.txt — крошечный текстовый файл, который лежит в корне вашего сайта. Его задача — сказать поисковому роботу: «Вот сюда заходи, а вот сюда — не надо.» Файл весит пару килобайт, но одна ошибка в нём может полностью удалить сайт из Google. Без преувеличений — я видел такое не раз.
Что происходит, когда робот заходит на сайт
Робот Google или Яндекса первым делом обращается к адресу yoursite.com/robots.txt. Там он читает правила: какие разделы можно сканировать, какие нельзя, и где лежит карта сайта. Только после этого начинает обходить страницы.
Вот как выглядит типичный robots.txt:
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /cart/
Sitemap: https://yoursite.com/sitemap.xml
Тут всё просто: звёздочка — правило для всех роботов. Слэш после Allow — разрешение сканировать весь сайт. Disallow закрывает конкретные разделы. Sitemap подсказывает, где найти полный список страниц.
Какие страницы прятать от поисковиков
На любом сайте есть страницы, которым в поисковой выдаче делать нечего:
- •Админка (/admin/, /wp-admin/) — мало того что бесполезна в поиске, так ещё и лишнее внимание к ней ни к чему
- •Корзина и оформление заказа (/cart/, /checkout/) — создают дубли контента
- •Страницы фильтров (/catalog?color=red&size=xl) — каждая комбинация фильтров порождает новый URL, а это тысячи мусорных страниц
- •Внутренний поиск (/search?q=...) — бесконечное число страниц с разными запросами
- •Служебные разделы (/login/, /register/, /api/) — не несут ценности для поисковика
Готовые шаблоны для популярных CMS
Для WordPress:
User-agent: *
Allow: /
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-content/plugins/
Disallow: /?s=
Sitemap: https://yoursite.com/sitemap.xml
Для Next.js (на нём работает наш сайт):
User-agent: *
Allow: /
Disallow: /api/
Disallow: /_next/
Sitemap: https://yoursite.com/sitemap.xml
Четыре ошибки, которые ломают SEO
Disallow: / (закрыть весь сайт). Одна строчка — и сайт исчезает из поиска. Самое страшное, что это может произойти случайно: разработчик закрыл сайт на время тестирования и забыл открыть. Я лично видел случай, когда интернет-магазин в Минске терял 3000 визитов в день три недели подряд, пока кто-то не догадался проверить robots.txt.
Файла нет вообще. Не критично, но неоптимально — робот будет сканировать всё подряд, включая мусорные страницы. Создать robots.txt — дело пяти минут, нет причин этого не делать.
Закрыть CSS и JavaScript. Google рендерит страницы как браузер — ему нужны стили и скрипты, чтобы оценить, как сайт выглядит на мобильном. Заблокируете их — Google не сможет проверить адаптивность.
Путать Disallow с запретом индексации. Тонкий момент: robots.txt запрещает сканирование, но не индексацию. Если на закрытую страницу ведут внешние ссылки, Google может её проиндексировать, просто не заходя на неё. Для полного запрета индексации используйте мета-тег noindex в HTML-коде страницы.
Как убедиться, что всё настроено правильно
- •Откройте yoursite.com/robots.txt прямо в браузере — файл должен быть виден
- •В Google Search Console есть инструмент проверки robots.txt — он подсветит ошибки
- •В Яндекс Вебмастере — раздел «Анализ robots.txt», проверит корректность по правилам Яндекса
Взяли за правило: после каждого обновления сайта, после смены CMS, после переезда на новый домен — проверьте robots.txt. Пять минут проверки могут спасти месяцы позиций.
На наших проектах robots.txt и техническая база настроены с первого дня. Например, у СпецГидроТех за 2 месяца поисковики корректно проиндексировали 1065 страниц каталога — 55% трафика пришло из органического поиска.