Определение
robots.txt — это служебный файл в корне сайта, который содержит инструкции для поисковых роботов.
Он сообщает, какие разделы сайта можно сканировать, а какие следует игнорировать.
Файл размещается по адресу:
https://site.ru/robots.txt
Как работает robots.txt
Когда робот заходит на сайт, он сначала обращается к файлу robots.txt и проверяет правила доступа.
Через директивы можно:
- запретить сканирование отдельных разделов
- ограничить обработку параметров
- разрешить доступ к техническим файлам
- указать путь к карте сайта
Важно: robots.txt управляет сканированием, а не гарантирует удаление страницы из индекса.
Основные директивы
- User-agent — для какого робота действует правило
- Disallow — запрет на сканирование
- Allow — разрешение на сканирование
- Sitemap — ссылка на карту сайта
- Clean-param — указание параметров, которые нужно игнорировать (актуально для Яндекса)
Поисковые системы, такие как Google и Яндекс, могут по-разному учитывать некоторые директивы.
Пример robots.txt для WordPress с разбивкой по поисковикам
Ниже приведён пример конфигурации, в которой правила разделены для всех роботов, GoogleBot и Yandex.
User-agent: *
Disallow: /cgi-bin
Disallow: /?
Disallow: /wp-
Disallow: /wp/
Disallow: *?s=
Disallow: *&s=
Disallow: /search/
Disallow: /author/
Disallow: /users/
Disallow: */trackback
Disallow: */feed
Disallow: */rss
Disallow: */embed
Disallow: */wlwmanifest.xml
Disallow: /xmlrpc.php
Disallow: *utm*=
Disallow: *openstat=
Allow: */uploads
Allow: /*/*.js
Allow: /*/*.css
Allow: /wp-*.png
Allow: /wp-*.jpg
Allow: /wp-*.jpeg
Allow: /wp-*.gif
Allow: /wp-admin/admin-ajax.php
User-agent: GoogleBot
Disallow: /cgi-bin
Disallow: /?
Disallow: /wp-
Disallow: /wp/
Disallow: *?s=
Disallow: *&s=
Disallow: /search/
Disallow: /author/
Disallow: /users/
Disallow: */trackback
Disallow: */feed
Disallow: */rss
Disallow: */embed
Disallow: */wlwmanifest.xml
Disallow: /xmlrpc.php
Disallow: *utm*=
Disallow: *openstat=
Allow: */uploads
Allow: /*/*.js
Allow: /*/*.css
Allow: /wp-*.png
Allow: /wp-*.jpg
Allow: /wp-*.jpeg
Allow: /wp-*.gif
Allow: /wp-admin/admin-ajax.php
User-agent: Yandex
Disallow: /cgi-bin
Disallow: /?
Disallow: /wp-
Disallow: /wp/
Disallow: *?s=
Disallow: *&s=
Disallow: /search/
Disallow: /author/
Disallow: /users/
Disallow: */trackback
Disallow: */feed
Disallow: */rss
Disallow: */embed
Disallow: */wlwmanifest.xml
Disallow: /xmlrpc.php
Allow: */uploads
Allow: /*/*.js
Allow: /*/*.css
Allow: /wp-*.png
Allow: /wp-*.jpg
Allow: /wp-*.jpeg
Allow: /wp-*.gif
Allow: /wp-admin/admin-ajax.php
Clean-Param: utm_source&utm_medium&utm_campaign
Clean-param: utm
Clean-param: etext
Clean-param: pm_source
Clean-Param: openstat
Sitemap: https://site.ru/sitemap_index.xml
Что делает этот пример
В данной конфигурации:
- закрываются технические и служебные разделы WordPress
- блокируются результаты поиска и параметры
- разрешается доступ к файлам стилей и скриптам
- отдельно учитываются параметры для Яндекса через
Clean-param - указывается путь к карте сайта
Такой подход позволяет более гибко управлять сканированием для разных поисковых систем.
Что важно помнить
- robots.txt не защищает сайт от доступа пользователей
- файл не удаляет страницы из индекса
- ошибки в robots.txt могут повлиять на сканирование всего сайта
- изменения начинают действовать после повторного обхода роботом
Перед внесением правок желательно проверять файл в инструментах для вебмастеров.
Краткий вывод
robots.txt — это инструмент управления сканированием сайта. Он помогает ограничить доступ к техническим разделам и направить поисковых роботов по нужной структуре.
Грамотная настройка особенно важна для сайтов на WordPress, где присутствует множество служебных страниц и параметров.








