Файл robots.txt — это главный служебный документ, с которого начинается взаимодействие поискового робота с вашим сайтом. Грамотная настройка управляющих директив позволяет защитить ресурс от сканирования технического мусора, сэкономить краулинговый бюджет и ускорить попадание важных страниц в выдачу. В данном руководстве собрана полная информация по созданию, синтаксису и проверке файла с готовыми примерами для популярных CMS. Изучите структурированный план статьи, чтобы быстро перейти к интересующему разделу или инструкции.
Содержание
- Что такое robots.txt
- Для чего нужен robots.txt
- Требования к файлу robots.txt
- Как создать robots.txt и добавить на сайт
- Синтаксис и структура robots.txt
- Спецсимволы и операторы (*, $, #)
- Основные директивы robots.txt
- Что закрывать в robots.txt, а что нельзя
- Примеры и шаблоны robots.txt для CMS
- Robots.txt или meta robots
- Как проверить robots.txt
- Частые ошибки и как их исправить
- Часто задаваемые вопросы
- Заключение
Освоение работы с robots.txt является базовым навыком для каждого SEO-специалиста, маркетолога и владельца сайта. Перейдем к детальному разбору всех аспектов настройки.
Что такое robots.txt
Служебный документ robots.txt представляет собой простой текстовый файл в корневой директории веб-ресурса. Данный файл выступает сводом инструкций для автоматических сканеров поисковиков. При посещении площадки автоматический паук первым делом запрашивает именно эти указания.
Любой интернет-проект насчитывает множество URL-адресов, скриптов и системных папок. Для изучения содержимого сеть обходят специализированные программы — краулеры. Каждая платформа задействует персональных сканеров. К примеру, модуль googlebot сканирует страницы для базы Google, а веб-боты Яндекса обрабатывают ресурсы под рунет.
Грамотно составленный файл распределяет права доступа. Он определяет открытые для обработки зоны и изолирует системные каталоги.
Команды в robots.txt воспринимаются алгоритмами как пожелание, а не жесткая блокировка. Поисковая система может добавить адрес в базу данных, если на него ссылаются внешние авторитетные площадки.

Для чего нужен robots.txt
Главная задача файла robots.txt — грамотно распределять краулинговый бюджет сайта. Краулинговый бюджет представляет собой лимит страниц, который поисковый бот способен просканировать на вашем сервере за один визит. Если краулер расходует ресурсы на технический мусор, важный контент попадает в индекс с большой задержкой.
Правильно настроенный файл позволяет эффективно решать следующие SEO-задачи:
- Запрещать сканирование служебных файлов. Страницы с личными данными пользователей, корзина покупателя и admin-панель не должны попадать в выдачу.
- Убирать дубли страниц. В процессе работы CMS часто создает технические копии страниц, результаты поиска по сайту и пути с параметрами фильтрации.
- Защищать сервер от перегрузок. Ограничение частоты и объема обхода снижает нагрузку на базу данных и процессор хостинга.
- Указывать путь к карте сайта. Команда со ссылкой на XML-карту помогает краулерам находить новые статьи и товары за минимальное время.
Оптимизация обхода прямым образом влияет на техническое продвижение проекта. Если поисковик быстро находит нужный материал, сайт занимает более высокие позиции в результатах поиска.
Требования к файлу robots.txt
К оформлению текстового документа предъявляются строгие технические правила. Ошибка в одном символе может полностью заблокировать индексацию ресурса или открыть закрытый доступ к конфиденциальным данным.
| Параметр файла | Обязательное требование |
| Имя и расширение | Только строчные буквы: robots.txt |
| Расположение | Строго в корневой папке сайта (/robots.txt) |
| Кодировка | Стандартная кодировка UTF-8 без BOM |
| Размер файла | Не более 500 КБ (для Яндекса и Google) |
| Формат адреса | Использование относительных путей для директив |
Поисковый робот ищет файл только по строго определенному URL-адресу. Вы должны располагать файл в корне проекта, например: https://site.ru/robots.txt или https://domain.com/robots.txt. Если поместить документ в подкаталог вида https://site.ru/catalog/robots.txt, поисковик просто не будет его читать.
Обратите внимание на протокол вашего ресурса. Адрес должен быть доступен по защищенному протоколу https, а сервер должен отдавать правильный код ответа 200 OK.
Как создать robots.txt и добавить на сайт
Создание корректного конфигурационного файла состоит из нескольких последовательных этапов. Для подготовки документа можно использовать обычный текстовый редактор или продвинутый инструмент Notepad++.
Процесс создания и размещения включает в себя простые действия:
- Создайте новый файл. Откройте текстовый редактор и укажите формат кодировки UTF-8.
- Напишите базовые правила. Добавьте необходимые секции, укажите наименование бота и директивы доступа.
- Сохраните файл. Присвойте файлу правильное имя robots.txt.
- Загрузите файл на хостинг. Используйте FTP-клиент или файловый менеджер панели управления хостинга. Разместите документ в корневой папке сайта.
- Проверьте доступность. Откройте адрес https://ваш-сайт.ru/robots.txt в браузере. Файл должен открываться без ошибок.
Многие современные CMS позволяют настраивать robots.txt через встроенный административный интерфейс или специальные плагины (например, Yoast SEO для WordPress или Rank Math).
Синтаксис и структура robots.txt
Синтаксис файла состоит из отдельных блоков правил. Каждый блок начинается с указания конкретного робота, для которого предназначены следующие далее команды. Каждая новая команда пишется с новой строки.
Структура документа подчиняется жестким правилам обработки:
User-agent: *
Disallow: /admin/
Disallow: /search/
Allow: /catalog/
User-agent: Yandex
Disallow: /wp-admin/
Clean-param: utm_source&utm_medium
Sitemap: https://site.ru/sitemap.xml
В приведенном примере первое правило распространяется на абсолютно всех ботов. Вторая секция содержит отдельное правило, которое будет читать только поисковый робот Яндекс.
Разные поисковики могут по-разному воспринимать отдельные инструкции. Поэтому важно составлять правила аккуратно, чтобы не закрыть нужный контент от индексирования.
Спецсимволы и операторы (*, $, #)
Для упрощения записи правил и гибкой настройки доступа используются специальные операторы и символ комментария. Они позволяют закрывать от бота целые группы похожих страниц без перечисления каждого адреса.
Основные спецсимволы синтаксиса:
- Звездочка (*) — означает любую последовательность символов. Символ позволяет задавать маску пути. Запись Disallow: /catalog/*? запрещает доступ к любым URL в каталоге, содержащим знак вопроса (например, параметры фильтрации или сортировки).
- Знак доллара ($) — обозначает строгий конец строки. Если нужно закрыть файлы определенного формата, используют запись Disallow: /*.php$. Поисковик заблокирует адреса с расширением .php, но откроет доступ к страницам вида /page.php?id=1.
- Решетка (#) — используется для добавления текстовых комментариев. Все символы в строке после знака # игнорируются роботами. С помощью комментариев удобно оставлять пояснения к настройкам.
Если ваш сайт содержит кириллические символы в URL (например, в доменах .рф или русской категории каталога), их необходимо кодировать. В путях robots.txt применяют Percent-encoding (процентное кодирование) для путей и Punycode для доменных имен.
Основные директивы robots.txt
Разберем подробнее ключевые команды, которые используются для составления инструкции поисковым системам. Понимание работы каждой команды позволяет правильно настраивать сканирование ресурса.
User-agent
Директива User-agent задает имя робота, которому адресованы последующие правила. Она является обязательной и всегда открывает блок команд.
User-agent: Googlebot
Disallow: /private/
Если нужно задать общие настройки для всех ботов, используют универсальный символ звездочки: User-agent: *.
Disallow
Директива Disallow задает запрет на сканирование указанного раздела или отдельной страницы. С помощью этой команды закрывают служебные данные от обхода.
User-agent: *
Disallow: /wp-json/
Disallow: /cart/
Если оставить значение директивы пустым (Disallow:), это означает, что боту разрешен доступ ко всем разделам ресурса.
Allow
Директива Allow разрешает индексировать конкретную страницу или вложенную папку внутри запрещенного через Disallow каталога.
User-agent: *
Disallow: /catalog/
Allow: /catalog/open-category/
В данном случае робот не будет сканировать весь каталог, но обязательно проверит папку /open-category/.
Sitemap.xml
Директива Sitemap указывает поисковикам прямой путь к XML-карте сайта. Это ускоряет обнаружение новых страниц.
Sitemap: https://site.ru/sitemap.xml
В отличие от других команд, строку Sitemap можно размещать в любом месте файла. Обязательно указывать абсолютный путь к карте сайта, включая протокол https или http и доменное имя.
Clean-param
Директива Clean-param используется для работы с метками и параметрами отслеживания (например, utm-метками или идентификаторами сессий). Она помогает исключить дублирование страниц в поиске Яндекс.
Clean-param: utm_source&utm_medium&utm_campaign
Эта строчка сообщает Яндексу, что ссылки с указанными параметрами ведут на идентичный контент, и их не нужно повторно индексировать как отдельные страницы.
Что закрывать в robots.txt, а что нельзя
Правильное разграничение доступа — главная цель оптимизатора. Чрезмерные запреты могут нанести вред продвижению, так как поисковик не сможет оценить дизайн и контент страницы.
| Что НУЖНО закрывать в robots.txt | Что НЕЛЬЗЯ закрывать в robots.txt |
| Админ-панель и служебные скрипты | Основные страницы с уникальным контентом |
| Результаты поиска по сайту | Файлы стилей CSS и скрипты JavaScript |
| Личные кабинеты пользователей | Изображения, шрифты и медиафайлы |
| Страницы оформления заказа и корзину | Разделы категорий и карточки товаров |
| Дубли страниц с метками (параметрами) | Главную страницу сайта |
Если заблокировать доступ к стилям CSS и скриптам JS, робот googlebot не сможет построить корректный внешний вид страницы. Это приведет к сильному понижению позиций в выдаче Google.
Примеры и шаблоны robots.txt для CMS
Каждая популярная система управления контентом (CMS) имеет свою специфическую структуру папок и служебных файлов. Ниже приведены проверенные базовые шаблоны для распространенных движков.
Шаблон для WordPress
Платформа WordPress генерирует множество технических адресов в процессе работы. Движок автоматически создает ленты новостей, страницы авторов и многочисленные дубли с GET-параметрами.
Без правильных ограничений робот расходует краулинговый бюджет на служебные ресурсы. Обязательно закрывайте доступ к системным библиотекам и админ-панели. При этом важно оставлять открытым файл admin-ajax.php для корректной работы интерактивных скриптов на сайте.
Конфигурация правил для WordPress:
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /wp-includes/
Disallow: /xmlrpc.php
Disallow: /*?*
Disallow: /*?
Disallow: /wp-json/
Disallow: /trackback/
Disallow: /feed/
Sitemap: https://site.ru/sitemap.xml
Шаблон для Bitrix
Система 1C-Bitrix имеет разветвленную структуру папок с компонентами и модулями. Платформа активно использует внутренние скрипты для обработки данных и взаимодействия с пользователями.
Главная задача настройки — скрыть системные библиотеки, сохраненные сессии и служебные формы. Однако абсолютная блокировка папки /bitrix/ приведет к нарушению отображения верстки. Поэтому открывающие директивы Allow должны обязательно разрешать сканирование шаблонов и стилей.
Конфигурация правил для Bitrix:
User-agent: *
Disallow: /bitrix/
Allow: /bitrix/components/
Allow: /bitrix/js/
Allow: /bitrix/templates/
Disallow: /upload/
Allow: /upload/iblock/
Disallow: /search/
Disallow: /auth/
Disallow: /personal/
Sitemap: https://site.ru/sitemap.xml
Шаблон для ModX
Архитектура ModX скрывает основную логику управления внутри ядра системы. Движок создает динамические адреса и служебные коннекторы для работы базы данных.
При настройке необходимо изолировать менеджер управления и системные папки от сканирования. Также следует заблокировать прямой доступ к исполняемым файлам с расширением .php. Это защитит сайт от индексации технических скриптов.
Конфигурация правил для ModX:
User-agent: *
Disallow: /manager/
Disallow: /core/
Disallow: /connectors/
Disallow: /*?*
Disallow: /*.php$
Sitemap: https://site.ru/sitemap.xml
Шаблон для OpenCart
Интернет-магазины на OpenCart страдают от появления множества дублирующих страниц. Фильтры товаров, сортировки по ценам и пагинация создают тысячи однотипных URL-адресов.
Необходимо четко разграничивать коммерческие категории и системные страницы оформления заказа. Блокировка корзины и личных кабинетов сохранит ресурсы робота для сканирования карточек товаров. Использование регулярных выражений поможет отсечь сортировки в каталоге.
Конфигурация правил для OpenCart:
User-agent: *
Disallow: /index.php?route=checkout/
Disallow: /index.php?route=account/
Disallow: /index.php?route=product/search
Disallow: /*?sort=
Disallow: /*?order=
Disallow: /*?limit=
Disallow: /admin/
Sitemap: https://site.ru/sitemap.xml
Шаблон для Joomla
Структура Joomla включает в себя множество служебных каталогов с плагинами и языковыми пакетами. Стандартные настройки платформы часто блокируют доступ к графике и стилям.
При составлении файла нужно открыть роботам путь к папке с изображениями и системным скриптам. Служебные компоненты, логи и временные папки следует полностью изолировать от индексации. Это обеспечит корректное построение внешнего вида страниц в поиске.
Конфигурация правил для Joomla:
User-agent: *
Disallow: /administrator/
Disallow: /bin/
Disallow: /cli/
Disallow: /includes/
Disallow: /installation/
Disallow: /language/
Disallow: /logs/
Disallow: /tmp/
Sitemap: https://site.ru/sitemap.xml
Robots.txt или meta robots
Каждый вебмастер должен понимать разницу между файлом robots.txt и мета-тегом robots. Инструменты решают разные технические задачи при продвижении сайта.
Файл robots.txt задает основные правила для сканирования сервера. Поисковый краулер просто не загружает закрытый раздел или каталог. Это напрямую экономит время и ресурсы хостинга.
Мета-тег robots размещается внутри HTML-кода конкретной страницы:
<meta name="robots" content="noindex, follow">
Данный тег управляет процессом индексирования контента. Робот скачивает HTML-код, но не добавляет URL в результаты поиска.
Для удаления страницы из выдачи используйте мета-тег noindex. Запрет в robots.txt лишь блокирует повторный обход документа.
Как проверить robots.txt
После редактирования файла необходимо провести тестирование всех внесенных правил. Ошибка в одной строке может заблокировать продвижение ресурса.
Проверить корректность настройки помогают специальные сервисы:
- Инструмент «Анализ robots.txt» в Яндекс.Вебмастере. Сервис мгновенно находить синтаксические ошибки и показывает статус доступа к целевым страницам.

- Инструмент проверки Google Search Console. Помогает узнать реакцию бота googlebot на каждую директиву и проверяет файлы стилей.

- Сторонние аудиторы и SEO-программы. Автоматические сканеры выявляют закрытый контент и технический дубликат по всему сайту.

Регулярная проверка исключает случайный запрет на индексирование важных страниц. Тестируйте файл после каждого изменения структуры вашего веб-ресурса.
Частые ошибки и как их исправить
Даже опытные специалисты по оптимизации иногда допускают промахи при составлении служебного файла. Рассмотрим самые частые ошибки и методы их устранения.
Распространенные проблемы и их решения:
- Закрытие всего сайта от индексации. Запись Disallow: / полностью блокирует доступ ботам. При запуске проекта на рабочем домене обязательно удаляйте этот запрет.
- Блокировка CSS и JS файлов. Не закрывайте служебные директории со стилями. Добавляйте открывающие правила Allow: /*.css и Allow: /*.js.
- Перечисление нескольких карт сайта через запятую. Каждая директива Sitemap должна прописываться с новой строки.
- Ошибки в названии файла. Файл с именем Robots.txt или robots.htm не будет восприниматься поисковыми системами.
- Использование кириллицы в путях. Все русскоязычные URL-адреса и символы в файле следует прописывать в формате Punycode или URL-encode.
Часто задаваемые вопросы
Каким образом файл сказывается на SEO-показателях проекта?
Инструкция сокращает нецелевой расход ресурсов краулера. Поисковик сфокусируется на ценных разделах и быстрее добавит их в выдачу.
За какой срок алгоритмы перечитывают внесенные правки?
Паук сохраняет копию документа в локальный кэш. Перепроверка правил занимает от пары суток до четырнадцати дней.
Скрывает ли файл персональную информацию от посторонних лиц?
Нет, документ находится в открытом доступе для любого посетителя. Для ограничения приватных зон применяйте авторизацию на сервере.
Стоит ли ставить ссылку на sitemap, если карта загружена в панели вебмастеров?
Да, это обязательный шаг настройки. Запись упрощает поиск карты абсолютно всем автоматическим сканерам в сети.
Как поведут себя роботы при полном отсутствии файла в корне?
Сервер выдаст стандартное сообщение 404. Сканер расценит это как полное отсутствие каких-либо барьеров и начнет сплошной обход.
Заключение
Грамотная работа с robots.txt — это фундамент успешной SEO-оптимизации проекта. Контроль работы краулеров позволяет ускорить индексацию целевых страниц и поднять сайт в выдаче.
Для эффективного технического SEO соблюдайте следующие правила:
- Открывайте путь к важным элементам. Поисковый бот должен видеть CSS, JS и графику для верной оценки дизайна.
- Закрывайте мусорные адреса. Исключайте из обхода дубли, параметры фильтров и личные данные пользователей.
- Используйте связку с мета-тегами. Сочетайте правила файла с тегом noindex для полной чистки индекса.
- Проверяйте правки перед запуском. Тестируйте синтаксис через Вебмастер, чтобы не потерять органический трафик.
Оптимизированный файл помогает поисковикам мгновенно находить полезный контент. Это напрямую увеличивает охват целевой аудитории и приносит больше клиентов из поиска.

Мы перезвоним



В избранное
Вход для клиентов
В избранное


