Robots txt инструкции, это набор директив в текстовом файле robots.txt, которыми сайт объясняет поисковым роботам, какие страницы можно сканировать, а какие обходить стороной. Один неверный символ в этом файле способен убрать из поиска весь сайт, поэтому владельцу бизнеса важно понимать, что там написано и кто это менял.
Мы в lucky-seo продвигаем сайты бизнеса и регулярно находим на аудите одну и ту же беду: robots.txt случайно закрыл от индексации нужные разделы, а заявки из поиска тем временем падали месяцами. Эта статья разбирает файл с позиции результата для бизнеса: как читать директивы, как их настроить по шагам и где чаще всего теряют трафик. Технику даём корректно, но без занудства ради занудства.
- Что такое robots txt инструкции и зачем это нужно бизнесу
- Как работает файл robots txt и его основные директивы
- Пошаговая инструкция по настройке robots txt
- Преимущества и ограничения управления через robots txt
- Сравнение robots txt с другими способами закрыть страницу
- Примеры использования robots txt для разного бизнеса
- Часто задаваемые вопросы (FAQ)
- Частые вопросы
- Выводы
Что такое robots txt инструкции и зачем это нужно бизнесу
Robots txt инструкции (robots.txt directives), это команды в файле robots.txt, который лежит в корне сайта по адресу site.ru/robots.txt и первым читается поисковым роботом при заходе на сайт. Файл управляет сканированием: разрешает или запрещает роботам обходить конкретные страницы и разделы, указывает путь к карте сайта и задаёт правила для разных поисковиков.
Бизнесу это важно по простой причине: то, что закрыто в robots.txt, робот не обходит, а значит эти страницы хуже попадают в индекс и не приносят заявки. Правильно настроенный файл экономит краулинговый бюджет (crawl budget), то есть время, которое робот тратит на сайт, и направляет его на нужные страницы вместо служебных корзин, фильтров и личных кабинетов.
Ключевой нюанс, который упускают: robots.txt управляет сканированием, но не гарантированно закрывает страницу от показа в выдаче. Если на закрытую страницу ведут внешние ссылки, Google может показать её в результатах без описания. Для жёсткого запрета индексации используют мета-тег noindex, а не robots.txt.
Как работает файл robots txt и его основные директивы
Файл robots.txt работает по принципу блоков: каждый блок начинается со строки User-agent, где указан робот, к которому применяются правила, а дальше идут разрешающие и запрещающие директивы. Робот заходит на сайт, читает свой блок и следует его командам при обходе страниц.
Основных директив немного, и разобраться в них проще, чем кажется. User-agent задаёт адресата правил (звёздочка означает всех роботов). Disallow запрещает обход указанного пути. Allow разрешает обход, чаще всего внутри уже закрытого раздела. Sitemap указывает полный адрес карты сайта. Директива Clean-param для Яндекса помогает не плодить дубли из-за параметров в адресах.
Держите в robots.txt строку Sitemap с полным адресом карты сайта. Это помогает роботам быстрее находить новые страницы и ускоряет их попадание в индекс, а значит бизнес быстрее получает трафик на свежий контент.
Чем Disallow отличается от noindex?
Disallow запрещает роботу сканировать страницу, а noindex запрещает показывать её в выдаче, и это принципиально разные задачи. Disallow живёт в robots.txt и управляет обходом, noindex живёт в мета-теге на самой странице или в HTTP-заголовке и управляет индексацией.
Путаница между ними, это классическая ошибка. Если закрыть страницу через Disallow, робот к ней не пойдёт и не увидит noindex на ней, поэтому страница может остаться в выдаче по внешним ссылкам. Когда нужно надёжно убрать раздел из поиска, страницу оставляют открытой для сканирования и ставят на неё noindex, а не прячут в robots.txt.
Пошаговая инструкция по настройке robots txt
Настройка robots.txt, это не разовый подвиг, а короткая понятная процедура, которую стоит пройти по порядку. По нашему опыту продвижения такой порядок закрывает большинство ошибок ещё до того, как они утащат сайт из поиска.
- Откройте адрес site.ru/robots.txt в браузере и посмотрите, что там уже написано.
- Создайте текстовый файл в кодировке UTF-8 с именем строго robots.txt, если файла ещё нет.
- Добавьте строку User-agent со звёздочкой, чтобы задать правила для всех роботов.
- Закройте через Disallow служебные разделы: корзину, личный кабинет, страницы поиска по сайту, админку.
- Проверьте, что важные для продаж страницы (товары, услуги, статьи) не попали под запрет.
- Впишите строку Sitemap с полным адресом карты сайта, включая протокол.
- Загрузите файл в корневой каталог сайта, чтобы он открывался по адресу site.ru/robots.txt.
- Прогоните файл через инструмент проверки в Яндекс Вебмастере и Google Search Console.
- Через несколько дней проверьте в этих же панелях, что нужные страницы сканируются и попадают в индекс.
Порядок одинаков и для интернет-магазина, и для сайта услуг. Разница только в том, какие разделы закрывать: у магазина это фильтры и сортировки каталога, у сайта услуг обычно формы и служебные страницы.
Самая дорогая ошибка при работе с robots.txt, это забытая после разработки строка Disallow: / (косая черта после Disallow). Она закрывает весь сайт от роботов целиком. Такое часто остаётся с тестовой версии, сайт молча выпадает из поиска, а бизнес недели ищет причину падения заявок не там, где надо.
Преимущества и ограничения управления через robots txt
Robots.txt даёт быстрый и бесплатный контроль над тем, куда ходят поисковые роботы, но у этого инструмента есть чёткие границы применимости. Понимать их важно, чтобы не поручать файлу задачу, с которой он не справляется.
Сильные стороны очевидны. Файл экономит краулинговый бюджет, убирая роботов со служебных и мусорных страниц, снижает нагрузку на сервер от лишних обходов и помогает избежать индексации дублей и технического хлама. Всё это работает сразу после загрузки файла и не требует ни разработчика на постоянной основе, ни платных сервисов.
Ограничения тоже честные. Robots.txt носит рекомендательный характер: добросовестные роботы Яндекса и Google его соблюдают, а вредоносные парсеры и боты могут игнорировать. Файл не защищает приватные данные, потому что список закрытых путей виден всем, кто открыл robots.txt. И он не удаляет страницу из выдачи, если она уже туда попала и на неё ведут ссылки.
Сравнение robots txt с другими способами закрыть страницу
Robots.txt, это лишь один из инструментов управления индексацией, и для разных задач подходят разные способы. Ниже сведены основные варианты, чтобы вы видели, когда какой применять и что реально получаете на выходе.
| Способ | Что делает | Когда применять | Скрывает из выдачи |
|---|---|---|---|
| Disallow в robots.txt | запрещает сканирование страницы | служебные разделы, дубли, экономия обхода | нет, не гарантированно |
| Мета-тег noindex | запрещает показ страницы в выдаче | убрать раздел из поиска надёжно | да |
| Пароль или закрытая зона | блокирует доступ полностью | приватные данные, личные кабинеты | да, страница недоступна |
| Атрибут rel canonical | указывает главную версию дубля | похожие страницы, версии с параметрами | склеивает дубли, не прячет |
| Заголовок HTTP 410 или 404 | сообщает, что страницы нет | удалённые страницы | да, со временем |
Из таблицы видно главное правило выбора. Нужно просто не гонять робота по мусору, это Disallow в robots.txt. Нужно надёжно убрать страницу из поиска, это noindex. Нужно спрятать приватные данные, это пароль, а не robots.txt. Смешивать эти задачи, значит получать неожиданные последствия для трафика.
Можно ли закрыть весь сайт через robots txt?
Закрыть весь сайт через robots.txt можно строкой Disallow: / внутри блока User-agent, но делать это на рабочем сайте почти никогда не нужно. Такой запрет уместен только для тестовых и разрабатываемых версий, которые не должны попадать в поиск.
На боевом сайте полный запрет, это авария: сайт постепенно исчезает из выдачи, теряет весь поисковый трафик и вместе с ним заявки. Если задача, временно скрыть новую версию от индексации, лучше закрыть её паролем на уровне сервера, а не оставлять открытым файл, который легко забыть переключить обратно.
Примеры использования robots txt для разного бизнеса
Robots.txt выглядит по-разному в зависимости от типа сайта, потому что закрывать нужно разные разделы. По практике проектов покажем типичные сценарии без выдуманных цифр, чтобы логика была понятна на живых примерах.
Для интернет-магазина главная работа, это фильтры, сортировки и параметры в адресах. Страницы вида каталог с сортировкой по цене и десятком галочек фильтра плодят тысячи почти одинаковых адресов, и робот тратит на них обход впустую. Такие страницы закрывают через Disallow по маске параметров, а для Яндекса дополнительно чистят через Clean-param, чтобы карточки товаров получали больше внимания робота.
Для сайта услуг набор проще. Закрывают формы благодарности после отправки заявки, служебные страницы, результаты внутреннего поиска и версии для печати. Важные продающие страницы услуг оставляют полностью открытыми, а в файл добавляют Sitemap, чтобы робот быстрее находил новые статьи и услуги.
Для сайта на популярной CMS есть своя ирония: движок часто генерирует стандартный robots.txt сам, и владелец уверен, что всё в порядке. На деле шаблонный файл нередко либо закрывает лишнее, либо не закрывает служебные разделы конкретно вашей сборки. Готовый robots.txt из интернета, это не рабочий вариант, а черновик, который нужно править под свой сайт.
Отдельный честный сюжет из аудитов. Бизнес приходит с жалобой, что трафик из поиска просел без видимой причины: сайт работает, тексты на месте, реклама крутится. А в robots.txt после последнего обновления сайта осталась закрытой целая категория товаров, и робот перестал её обходить. Пара строк в файле стоила компании месяцев потерянных заявок, и это не редкий случай, а типовая грабля.
Часто задаваемые вопросы (FAQ)
Частые вопросы
Где лежит файл robots txt на сайте?
Файл robots.txt лежит строго в корневом каталоге сайта и открывается по адресу site.ru/robots.txt. Если по этому адресу ничего нет или отдаётся ошибка, значит файла на сайте нет, и роботы обходят его по умолчанию без ограничений.
Обязателен ли robots txt для сайта?
Robots.txt не обязателен: без него сайт всё равно индексируется, а роботы сканируют всё подряд. Но для любого коммерческого сайта файл нужен, чтобы закрыть служебные и мусорные страницы, сэкономить обход робота и направить его на страницы, которые приносят заявки.
Закрывает ли Disallow страницу от индексации полностью?
Нет, Disallow запрещает только сканирование, а не показ в выдаче. Если на закрытую страницу ведут внешние ссылки, поисковик может показать её в результатах без описания. Для надёжного удаления из поиска ставят мета-тег noindex на самой странице, оставив её открытой для обхода.
Как проверить правильность robots txt?
Проверить robots.txt можно бесплатными инструментами в Яндекс Вебмастере и Google Search Console: они показывают, какие страницы разрешены и запрещены текущими правилами. Введите адрес важной страницы в проверку и убедитесь, что продающие разделы открыты, а служебные закрыты.
Чем отличается robots txt для Яндекса и для Google?
Базовые директивы User-agent, Disallow, Allow и Sitemap понимают оба поисковика одинаково. Отличия в деталях: директива Clean-param работает только у Яндекса, а Google перестал учитывать директиву Crawl-delay. Для точной настройки под каждый поисковик задают отдельные блоки User-agent.
Что будет, если в robots txt ошибка?
Ошибка в robots.txt способна закрыть от роботов нужные страницы или весь сайт, из-за чего они выпадают из поиска и перестают приносить трафик. Самый опасный случай, это забытая строка Disallow: / после разработки. Поэтому файл проверяют после каждого крупного обновления сайта.
Выводы
Robots txt инструкции, это простой на вид, но чувствительный инструмент: пара строк в файле управляет тем, какие страницы робот обходит, а какие обходит стороной. Для бизнеса это напрямую про трафик и заявки, потому что закрытые по ошибке разделы просто перестают приводить клиентов из поиска.
Разберитесь в базовых директивах, закройте служебное, оставьте открытым продающее и обязательно проверяйте файл после каждого обновления сайта. Robots.txt решает задачу управления обходом, но не заменяет noindex для скрытия из выдачи и не защищает приватные данные. Если хотите глубже погрузиться в тему, пригодятся материалы про robots txt и подробный разбор того, как настроить robots txt под конкретный сайт.
Опубликовано в 2026 году. Проверено на актуальность: подход работает на текущих алгоритмах Яндекса и Google.
