robots.txt — что это и зачем нужен

robots seo Терминология

Определение

robots.txt — это служебный файл в корне сайта, который содержит инструкции для поисковых роботов.

Он сообщает, какие разделы сайта можно сканировать, а какие следует игнорировать.

Файл размещается по адресу:

https://site.ru/robots.txt

Как работает robots.txt

Когда робот заходит на сайт, он сначала обращается к файлу robots.txt и проверяет правила доступа.

Через директивы можно:

  • запретить сканирование отдельных разделов
  • ограничить обработку параметров
  • разрешить доступ к техническим файлам
  • указать путь к карте сайта

Важно: robots.txt управляет сканированием, а не гарантирует удаление страницы из индекса.


Основные директивы

  • User-agent — для какого робота действует правило
  • Disallow — запрет на сканирование
  • Allow — разрешение на сканирование
  • Sitemap — ссылка на карту сайта
  • Clean-param — указание параметров, которые нужно игнорировать (актуально для Яндекса)

Поисковые системы, такие как Google и Яндекс, могут по-разному учитывать некоторые директивы.


Пример robots.txt для WordPress с разбивкой по поисковикам

Ниже приведён пример конфигурации, в которой правила разделены для всех роботов, GoogleBot и Yandex.

User-agent: *
Disallow: /cgi-bin
Disallow: /?
Disallow: /wp-
Disallow: /wp/
Disallow: *?s=
Disallow: *&s=
Disallow: /search/
Disallow: /author/
Disallow: /users/
Disallow: */trackback
Disallow: */feed
Disallow: */rss
Disallow: */embed
Disallow: */wlwmanifest.xml
Disallow: /xmlrpc.php
Disallow: *utm*=
Disallow: *openstat=
Allow: */uploads
Allow: /*/*.js
Allow: /*/*.css
Allow: /wp-*.png
Allow: /wp-*.jpg
Allow: /wp-*.jpeg
Allow: /wp-*.gif
Allow: /wp-admin/admin-ajax.php

User-agent: GoogleBot
Disallow: /cgi-bin
Disallow: /?
Disallow: /wp-
Disallow: /wp/
Disallow: *?s=
Disallow: *&s=
Disallow: /search/
Disallow: /author/
Disallow: /users/
Disallow: */trackback
Disallow: */feed
Disallow: */rss
Disallow: */embed
Disallow: */wlwmanifest.xml
Disallow: /xmlrpc.php
Disallow: *utm*=
Disallow: *openstat=
Allow: */uploads
Allow: /*/*.js
Allow: /*/*.css
Allow: /wp-*.png
Allow: /wp-*.jpg
Allow: /wp-*.jpeg
Allow: /wp-*.gif
Allow: /wp-admin/admin-ajax.php

User-agent: Yandex
Disallow: /cgi-bin
Disallow: /?
Disallow: /wp-
Disallow: /wp/
Disallow: *?s=
Disallow: *&s=
Disallow: /search/
Disallow: /author/
Disallow: /users/
Disallow: */trackback
Disallow: */feed
Disallow: */rss
Disallow: */embed
Disallow: */wlwmanifest.xml
Disallow: /xmlrpc.php
Allow: */uploads
Allow: /*/*.js
Allow: /*/*.css
Allow: /wp-*.png
Allow: /wp-*.jpg
Allow: /wp-*.jpeg
Allow: /wp-*.gif
Allow: /wp-admin/admin-ajax.php
Clean-Param: utm_source&utm_medium&utm_campaign
Clean-param: utm
Clean-param: etext
Clean-param: pm_source
Clean-Param: openstat

Sitemap: https://site.ru/sitemap_index.xml

Что делает этот пример

В данной конфигурации:

  • закрываются технические и служебные разделы WordPress
  • блокируются результаты поиска и параметры
  • разрешается доступ к файлам стилей и скриптам
  • отдельно учитываются параметры для Яндекса через Clean-param
  • указывается путь к карте сайта

Такой подход позволяет более гибко управлять сканированием для разных поисковых систем.


Что важно помнить

  • robots.txt не защищает сайт от доступа пользователей
  • файл не удаляет страницы из индекса
  • ошибки в robots.txt могут повлиять на сканирование всего сайта
  • изменения начинают действовать после повторного обхода роботом

Перед внесением правок желательно проверять файл в инструментах для вебмастеров.


Краткий вывод

robots.txt — это инструмент управления сканированием сайта. Он помогает ограничить доступ к техническим разделам и направить поисковых роботов по нужной структуре.

Грамотная настройка особенно важна для сайтов на WordPress, где присутствует множество служебных страниц и параметров.

⟵ К другим терминам

Оцените статью
SEO блог Леонова Дениса