Txt индексации robots, это файл robots.txt в корне сайта, который подсказывает поисковым роботам Яндекса и Google, какие разделы обходить, а какие обходить не нужно. Он не запрещает индексацию напрямую, а управляет обходом (crawling), поэтому для реального закрытия страниц из поиска его комбинируют с метатегом noindex.
Мы в lucky-seo продвигаем сайты бизнеса и почти в каждом техническом аудите находим один и тот же перекос: либо robots.txt закрывает лишнее и роняет трафик, либо не закрывает мусорные страницы и робот тратит ресурс впустую. В этом материале разложим по полкам, что делает файл на самом деле, как его собрать без ошибок и где бизнес чаще всего сам себе роет яму. Разберём на примерах и дадим пошаговую инструкцию, которую можно применить к своему сайту сегодня.
Что такое txt индексации robots и зачем это нужно
Файл robots.txt, это текстовый документ в корне домена по адресу вида site.ru/robots.txt, в котором прописаны правила обхода для поисковых роботов. Робот, прежде чем лезть по страницам, сначала читает этот файл и сверяет, куда ему разрешено, а куда закрыт вход. По сути это вахтёр на входе, который показывает роботу карту здания и таблички «служебное помещение».
Важный нюанс, который путает половину заказчиков: robots.txt управляет именно обходом, а не индексацией. Директива Disallow говорит роботу «не заходи сюда», но если на закрытую страницу ведут внешние ссылки, поисковик всё равно может показать её в выдаче без описания. Чтобы страница гарантированно не попала в поиск, её не закрывают в robots.txt, а открывают для обхода и ставят метатег robots со значением noindex. Тогда робот заходит, видит запрет на индексацию и убирает страницу из выдачи.
Бизнесу это нужно по двум причинам. Первая, чистота выдачи: чтобы клиент находил карточки товаров и посадочные страницы, а не корзину, личный кабинет или результаты внутреннего поиска. Вторая, бюджет обхода (crawl budget): у робота ограничен лимит страниц, которые он готов обойти за визит, и глупо тратить его на технический мусор вместо новых товаров и статей, которые приносят заявки.
Как правильно составить robots.txt: пошаговая инструкция
Сборка robots.txt, это не творчество, а работа по чёткому алгоритму, где важна каждая строка. По нашему опыту проектов один лишний слэш в директиве закрывал от обхода весь каталог интернет-магазина, поэтому порядок и проверка тут критичны.
- Откройте адрес site.ru/robots.txt в браузере и посмотрите, что там уже лежит: часто CMS генерирует файл сама, и его нужно править, а не создавать с нуля.
- Создайте или скачайте текстовый файл с именем строго robots.txt в кодировке UTF-8, другое имя робот не прочитает.
- Пропишите директиву User-agent, чтобы указать, к какому роботу относятся правила: звёздочка означает всех роботов сразу.
- Добавьте директивы Disallow для служебных разделов: корзина, оформление заказа, личный кабинет, внутренний поиск, страницы фильтров с параметрами.
- Добавьте Allow, если внутри закрытого раздела есть страницы, которые нужно оставить открытыми для обхода.
- Укажите директиву Sitemap с полным адресом карты сайта, чтобы робот быстрее нашёл все нужные страницы.
- Загрузите готовый файл в корневую папку сайта через FTP, панель хостинга или средствами CMS.
- Проверьте файл в инструменте анализа robots.txt в Яндекс Вебмастере и Google Search Console: они покажут ошибки синтаксиса и то, открыта или закрыта конкретная страница.
Порядок одинаковый для магазина, сайта услуг и корпоративного сайта. Отличаться будет только список закрываемых разделов, потому что мусорные страницы у каждого движка свои.
После каждой правки robots.txt проверяйте важные страницы в валидаторе Вебмастера, прежде чем закрыть вкладку. Тридцать секунд проверки спасают от ситуации, когда сайт неделями выпадает из поиска из-за одной невнимательной строки, а бизнес теряет заявки и даже не понимает, почему.
Какие страницы закрывать, а какие оставлять открытыми?
Закрывать в robots.txt нужно только технический мусор, который не должен попадать в поиск и не приносит трафика. Это админка, корзина и оформление заказа, личные кабинеты, страницы внутреннего поиска, дубли с параметрами сортировки и фильтров, служебные скрипты. Такие разделы съедают бюджет обхода и захламляют выдачу, пользы от них в поиске ноль.
Оставлять открытыми обязательно все посадочные страницы: карточки товаров, категории, услуги, статьи блога, контакты. Отдельно проследите, чтобы случайно не закрылись файлы стилей и скриптов. Если робот не видит CSS и JavaScript, он не понимает, как выглядит страница на мобильном, и это бьёт по ранжированию.
Чем Disallow отличается от noindex?
Disallow в robots.txt запрещает роботу обходить страницу, а noindex в метатеге запрещает включать её в поисковый индекс. Разница принципиальная: закрытая через Disallow страница может остаться в выдаче как ссылка без описания, если на неё кто-то сослался. Закрытая через noindex страница гарантированно уходит из поиска, потому что робот её всё-таки прочитал и увидел запрет.
Отсюда практическое правило. Хотите просто не пускать робота в служебный раздел, используйте Disallow. Хотите убрать конкретную страницу из выдачи наверняка, оставьте её открытой для обхода и поставьте метатег robots noindex. Смешивать эти инструменты в лоб нельзя: если закрыть страницу и в robots.txt, и через noindex, робот просто не зайдёт и не увидит noindex.
Преимущества и недостатки robots.txt
Robots.txt даёт простой контроль над обходом сайта, но у этого инструмента есть жёсткие границы, о которых бизнесу лучше знать заранее. Понимание плюсов и минусов защищает от типичной беды, когда файлом пытаются решить задачу, для которой он не предназначен.
Главный плюс, это экономия бюджета обхода. Закрыв мусорные разделы, вы направляете робота на важные страницы, и новые товары или статьи попадают в индекс быстрее. Второй плюс, чистота выдачи: клиент находит нужное, а не корзину или служебную страницу. Третий, простота: файл правится за минуты и не требует программиста для базовых задач.
Недостатки честные и важные. Robots.txt, это рекомендация, а не жёсткий закон: добросовестные роботы Яндекса и Google его слушаются, но вредоносные боты и парсеры игнорируют. Файл не защищает данные, потому что закрытый раздел виден любому, кто откроет сам robots.txt и прочитает список путей. И он не гарантирует удаление страницы из поиска, для этого нужен noindex или удаление через инструменты Вебмастера.
Самая дорогая ошибка, это строка Disallow: / в файле, которая закрывает от обхода весь сайт целиком. Такое случается, когда сайт переносят с тестового домена на боевой и забывают убрать запрет, оставшийся с разработки. Сайт неделями выпадает из выдачи, заявки падают до нуля, а причину ищут где угодно, только не в одной строке robots.txt. Проверяйте файл первым делом после запуска и переезда.
Сравнение способов управления индексацией
Robots.txt, это лишь один из инструментов управления тем, что попадает в поиск, и для каждой задачи есть свой правильный способ. Ниже сведены основные методы, чтобы вы не пытались забить гвоздь отвёрткой.
| Способ | Что делает | Когда применять | Гарантирует удаление из поиска |
|---|---|---|---|
| Disallow в robots.txt | запрещает обход раздела | служебные и мусорные разделы | нет, страница может остаться как ссылка |
| Метатег robots noindex | запрещает индексацию страницы | убрать конкретную страницу из выдачи | да, если страница открыта для обхода |
| Заголовок X-Robots-Tag | то же, что noindex, но для файлов | закрыть PDF, изображения, документы | да |
| Атрибут rel canonical | склеивает дубли в одну страницу | сортировки, фильтры, UTM-метки | нет, объединяет сигналы дублей |
| Удаление в Вебмастере | быстро убирает URL из выдачи | срочно скрыть страницу | да, но временно, нужна причина |
Из таблицы видно логику выбора. Нужно не пускать робота в служебный раздел и сэкономить обход, идём в robots.txt. Нужно гарантированно убрать страницу из поиска, ставим noindex. Нужно закрыть не HTML-страницу, а файл, используем X-Robots-Tag. Нужно свести дубли фильтров в одну страницу, применяем canonical. Часто эти инструменты работают в связке, а не по отдельности.
Можно ли закрыть сайт от индексации только через robots.txt?
Полностью и надёжно закрыть сайт от попадания в поиск одним robots.txt нельзя, потому что файл управляет обходом, а не индексом. Строка Disallow: / остановит обход, но страницы, на которые есть внешние ссылки, всё равно могут показаться в выдаче без описания. Для полного закрытия сайта на время разработки лучше использовать метатег noindex на всех страницах или закрыть доступ авторизацией на уровне сервера. Подробный разбор мы собрали в материалах про закрыть сайт от индексации robots txt и robots txt запрет индексации.
Примеры использования robots.txt
Robots.txt выглядит по-разному в зависимости от типа сайта, но логика везде одна: закрываем мусор, открываем посадочные страницы, показываем роботу карту сайта. Разберём типичные случаи из практики продвижения, без выдуманных цифр.
Для интернет-магазина главная задача, это отсечь бесконечные дубли, которые плодят фильтры, сортировки и параметры в адресах. Робот легко может уйти в тысячи почти одинаковых страниц вида «телефоны по цене от и до, сортировка по популярности» и сжечь на них весь бюджет обхода, так и не добравшись до новых карточек товаров. В robots.txt закрывают корзину, оформление заказа, сравнение, страницы с параметрами сортировки, а дубли фильтров дополнительно склеивают через canonical.
Для сайта услуг с привязкой к городу файл проще: закрывают служебные разделы и формы, а все посадочные страницы под запросы оставляют открытыми. Здесь важнее не закрыть лишнего, чем закрыть много, потому что на небольшом сайте каждая страница на счету и любая случайно закрытая посадочная, это потерянные заявки.
Для сайта на этапе разработки типичный сценарий, это временно закрыть весь тестовый домен от обхода строкой Disallow: /, чтобы недоделанная версия не попала в поиск. И тут прячется самая частая грабля бизнеса. Разработчик запускает боевую версию, но забывает снять запрет, и новый сайт неделями стоит невидимкой для поиска. Красивый дизайн есть, трафика нет, а все смотрят на рекламу и контент вместо того, чтобы открыть один текстовый файл. Тонкую настройку разбираем в гайдах как настроить robots txt и robots txt.
Частые вопросы
Что такое txt индексации robots простыми словами?
Это файл robots.txt в корне сайта, который подсказывает поисковым роботам, какие разделы обходить, а какие нет. Он работает как вахтёр на входе: показывает роботу, куда можно, а куда закрыт вход, и помогает не тратить бюджет обхода на служебные страницы.
Robots.txt закрывает страницу от индексации или нет?
Robots.txt управляет обходом, а не индексацией, поэтому напрямую он страницу из поиска не убирает. Закрытая через Disallow страница может остаться в выдаче как ссылка без описания, если на неё кто-то сослался. Для гарантированного удаления из поиска используют метатег robots noindex.
Где лежит файл robots.txt и как его открыть?
Файл лежит в корневой папке сайта и доступен по адресу вида site.ru/robots.txt, откуда его может прочитать любой. Открыть можно прямо в браузере, набрав этот адрес, а редактировать через FTP, панель хостинга или встроенные средства CMS.
Обязателен ли robots.txt для сайта?
Формально сайт работает и без robots.txt, но для продвижения он нужен почти всегда. Без него робот обходит все страницы подряд, включая служебный мусор, и тратит бюджет обхода впустую. Грамотный файл направляет робота на важные страницы и ускоряет их попадание в индекс.
Почему сайт пропал из поиска после правки robots.txt?
Чаще всего причина в строке Disallow: /, которая случайно закрыла от обхода весь сайт целиком. Такое бывает после переезда с тестового домена, когда забывают убрать запрет с разработки. Проверьте файл в валидаторе Яндекс Вебмастера и Google Search Console и уберите лишний запрет.
Как проверить, правильно ли настроен robots.txt?
Используйте инструмент анализа robots.txt в Яндекс Вебмастере и Google Search Console: они показывают ошибки синтаксиса и то, открыта или закрыта конкретная страница. Введите адреса важных посадочных страниц и убедитесь, что они разрешены к обходу, а служебные закрыты.
Выводы
Txt индексации robots, это простой, но обоюдоострый инструмент: правильно настроенный файл экономит бюджет обхода и чистит выдачу, а одна невнимательная строка роняет весь сайт из поиска. Главное помнить, что robots.txt управляет обходом, а не индексацией, поэтому для гарантированного удаления страниц из поиска его комбинируют с метатегом noindex.
Бизнесу стоит относиться к этому файлу как к части технического фундамента сайта, а не мелкой формальности. Проверьте свой robots.txt после каждого переезда и крупного обновления, закройте мусор, оставьте открытыми все посадочные страницы и файлы стилей, а сомнительные случаи прогоняйте через валидатор. Если разбираться самому некогда или сайт большой и запутанный, техническую базу под ключ разумнее доверить специалистам, чтобы не терять заявки из-за одной строки.
Опубликовано в 2026 году. Проверено на актуальность: подход работает на текущих алгоритмах Яндекса и Google.
