Robots txt запрет индексации, это управление доступом поисковых роботов к страницам сайта через служебный файл robots.txt и мета-теги, чтобы мусорные и служебные страницы не попадали в выдачу Яндекса и Google. Правильно закрытые дубли и корзины экономят краулинговый бюджет и удерживают в индексе только те страницы, что приносят заявки.
Мы в lucky-seo продвигаем сайты бизнеса и каждый месяц вычищаем чужие robots.txt, где случайно закрыт весь сайт или, наоборот, в поиск слит склад технических страниц. В этом гайде разложим по полкам, чем robots.txt отличается от мета-тега noindex, что закрывать обязательно, а что нельзя трогать, и покажем готовые примеры директив для разных задач.
- Что такое robots txt запрет индексации и зачем это нужно
- Чем сканирование отличается от индексации
- Закрытие от индексации постранично
- Как robots txt закрыть от индексации целые разделы
- Установка запрета сканирования для Google
- Запрет индексации изображений и файлов
- Запрет индексации через файл htaccess
- Как правильно закрыть сайт от индексации целиком
- Как запретить сканирование каталога и параметров
- Сравнение способов запрета индексации
- Частые вопросы
- Выводы
Что такое robots txt запрет индексации и зачем это нужно
Robots.txt, это текстовый файл в корне сайта, который подсказывает поисковым роботам, какие разделы можно обходить, а какие лучше обойти стороной. Через директиву Disallow вы закрываете от сканирования служебные, дублирующие и бесполезные для поиска страницы, чтобы робот тратил ресурс на важные разделы, а выдача не засорялась мусором.
Бизнесу это нужно по простой причине: у поисковика ограничен краулинговый бюджет (crawl budget), то есть число страниц, которые он готов обойти за визит. Если робот тратит его на корзину, фильтры каталога и страницы сортировки, до реально продающих страниц он доходит реже. Чистый robots.txt направляет внимание поисковика туда, где заявки.
Чем сканирование отличается от индексации
Сканирование (crawling), это обход страницы роботом, а индексация (indexing), это добавление её в базу поиска для показа в выдаче. Это два разных процесса, и путаница между ними, это причина большинства ошибок с robots.txt.
Директива Disallow в robots.txt запрещает именно сканирование, а не индексацию. Страница, закрытая через Disallow, но имеющая внешние ссылки, всё равно может попасть в выдачу, только без описания, с пометкой вроде «нет доступа к содержимому». Если задача убрать страницу из поиска, работает мета-тег noindex, а не запрет сканирования.
Самая частая и дорогая ошибка бизнеса, закрыть страницу в robots.txt в надежде убрать её из выдачи. Робот перестаёт видеть содержимое, но не может прочитать и мета-тег noindex внутри, поэтому страница застревает в индексе без описания. Чтобы удалить страницу из поиска, её нужно оставить открытой для сканирования и повесить noindex.
Закрытие от индексации постранично
Чтобы убрать из поиска конкретную страницу, надёжнее всего использовать мета-тег robots со значением noindex прямо в коде страницы, а не Disallow в robots.txt. Робот заходит на страницу, читает директиву и исключает её из выдачи при следующей переиндексации.
Мета-тег ставится в секцию head страницы:
html
<meta name="robots" content="noindex, nofollow">
Значение noindex убирает страницу из индекса, nofollow говорит не передавать вес по ссылкам с неё. Для точечной работы, когда нужно закрыть несколько конкретных URL (страница благодарности, личный кабинет, версия для печати), этот способ точнее, чем правки robots.txt, потому что не зависит от того, дошёл робот до файла или нет.
Как robots txt закрыть от индексации целые разделы
Чтобы закрыть от сканирования целый каталог или раздел, используйте директиву Disallow с указанием пути. Это основной сценарий, ради которого robots.txt и создавался: массово убрать из обхода служебные ветки сайта.
Базовая структура выглядит так:
User-agent: *
Disallow: /cart/
Disallow: /search/
Disallow: /*sort=
Первая строка задаёт, для какого робота правило (звёздочка, значит для всех). Дальше идут запреты: закрыты корзина, внутренний поиск и все URL с параметром сортировки. Символ звёздочки работает как маска: /*sort= закроет любой адрес, где встречается этот параметр. Если нужен подробный разбор синтаксиса, читайте отдельный материал про robots txt и о том, как настроить robots txt под конкретный сайт.
Не пишите robots.txt вслепую по чужому шаблону. Сначала выгрузите список страниц в индексе через Яндекс Вебмастер и Google Search Console, найдите мусорные шаблоны (фильтры, сортировки, дубли с параметрами) и только потом составляйте директивы под свой сайт. Чужой robots.txt почти всегда закрывает не то, что нужно вам.
Установка запрета сканирования для Google
Google ориентируется на директивы для User-agent Googlebot и общий блок со звёздочкой, а для удаления страниц из выдачи учитывает мета-тег noindex и заголовок ответа сервера. Отдельный нюанс: Google официально не поддерживает директиву Noindex внутри robots.txt, поэтому полагаться на неё нельзя.
Если нужно закрыть раздел только от Google, задайте отдельный блок:
User-agent: Googlebot
Disallow: /test/
Чтобы убрать страницу из выдачи Google, оставьте её открытой для сканирования и добавьте мета-тег noindex либо отдайте HTTP-заголовок X-Robots-Tag: noindex. Заголовок удобен для файлов, куда нельзя вставить мета-тег, например для PDF-документов.
Запрет индексации изображений и файлов
Чтобы закрыть от индексации картинки или документы, применяют директиву Disallow к папке с медиа или HTTP-заголовок X-Robots-Tag для отдельных файлов. Робот перестаёт брать эти файлы в поиск по картинкам и в общую выдачу.
Через robots.txt можно закрыть папку целиком или файлы по расширению:
User-agent: *
Disallow: /uploads/private/
Disallow: /*.pdf$
Для точечного запрета на конкретный файл, который должен оставаться доступным людям, но не поисковику, работает заголовок сервера:
X-Robots-Tag: noindex
Осторожно с картинками: если закрыть все изображения от Яндекса и Google, магазин теряет трафик из поиска по товарным фото. Закрывайте только служебную графику (иконки интерфейса, водяные знаки, тестовые загрузки), а продающие изображения оставляйте открытыми.
Запрет индексации через файл htaccess
Файл .htaccess на серверах Apache позволяет отдавать заголовок X-Robots-Tag на уровне сервера, что закрывает от индексации целые типы файлов без правки каждой страницы. Это резервный и очень надёжный способ: заголовок приходит вместе с ответом сервера, и робот получает его гарантированно.
Пример закрытия всех PDF и документов Word через .htaccess:
apache
<FilesMatch "\.(pdf|doc|docx)$">
Header set X-Robots-Tag "noindex, nofollow"
</FilesMatch>
Способ подходит, когда файлов много и вручную проставлять мета-теги нереально. Минус в том, что ошибка в .htaccess может уронить сайт целиком, поэтому правки делают через бэкап и проверяют отдачу заголовка инструментами вроде проверки ответа сервера в Яндекс Вебмастере.
Как правильно закрыть сайт от индексации целиком
Чтобы полностью закрыть сайт от поисковиков, добавьте в robots.txt запрет для всех роботов на весь сайт. Это стандартный шаг для тестовых версий, стейджинга и сайтов в разработке, чтобы черновик не попал в выдачу вперёд боевой версии.
Как правильно закрыть сайт от индексации robots txt, разберём на примере. Полная блокировка выглядит так:
User-agent: *
Disallow: /
Одинокий слэш после Disallow означает «весь сайт от корня». Такой robots.txt закрывает ресурс от сканирования целиком. Но помните про разницу процессов: если сайт уже в индексе, полный запрет сканирования не выкинет его из выдачи быстро, потому что робот не сможет прочитать команду на удаление. Для гарантированного скрытия боевой копии на разработке лучше закрывать доступ паролем на уровне сервера.
Ниже, пошаговый порядок, как закрыть сайт от индексации без потери боевого трафика.
- Определите, что именно закрываете: тестовый поддомен, отдельный раздел или весь боевой сайт.
- Создайте или откройте файл robots.txt в корне нужного сайта.
- Пропишите блок
User-agent: *и нужную директиву Disallow. - Для полного закрытия тестовой версии добавьте
Disallow: /под User-agent. - Сохраните файл и проверьте его в Яндекс Вебмастере через инструмент анализа robots.txt.
- Убедитесь, что боевой домен не задет: откройте его robots.txt в браузере и глазами проверьте, что там нет
Disallow: /. - Через несколько дней проверьте индекс боевого сайта, чтобы страницы не выпали.
Как запретить сканирование каталога и параметров
Чтобы закрыть отдельный каталог, укажите его путь в директиве Disallow, а для страниц с GET-параметрами используйте маску со звёздочкой. Именно каталоги фильтров, сортировок и результатов поиска чаще всего плодят дубли и съедают краулинговый бюджет интернет-магазина.
Типовой набор запретов для каталога и параметров:
User-agent: *
Disallow: /admin/
Disallow: /*?
Disallow: /*&utm_
Строка /*? закрывает все URL с параметрами, /*&utm_ убирает из обхода рекламные метки, которые иначе плодят копии страниц. Проверяйте такие правила аккуратно: слишком широкая маска может случайно закрыть важные страницы пагинации или фильтры, которые вы хотели оставить в поиске.
Сравнение способов запрета индексации
Разные задачи закрываются разными инструментами, и выбор между robots.txt, мета-тегом noindex и заголовком сервера решает, застрянет страница в индексе или уйдёт из него чисто. Ниже сведены основные способы, чтобы вы понимали, что закрывает сканирование, а что реально убирает из выдачи.
| Способ | Что делает | Когда применять | Убирает из выдачи |
|---|---|---|---|
| Disallow в robots.txt | Запрещает сканирование раздела | Массово закрыть служебные каталоги, параметры, корзину | Нет, только прячет содержимое |
| Мета-тег noindex | Убирает страницу из индекса | Точечно закрыть конкретные страницы | Да, при открытом сканировании |
| Заголовок X-Robots-Tag | Закрывает файлы на уровне сервера | PDF, документы, медиа без правки кода | Да |
| Запрет через .htaccess | Отдаёт X-Robots-Tag массово | Много файлов одного типа на Apache | Да |
| Пароль на сервере | Полностью скрывает доступ | Тестовые и стейджинг-версии | Да, страница вообще недоступна |
Главный вывод из таблицы: robots.txt управляет обходом, а не присутствием в поиске. Хотите убрать страницу из выдачи, оставьте её открытой для робота и повесьте noindex. Хотите сэкономить краулинговый бюджет на мусорных разделах, закрывайте их через Disallow.
Частые вопросы
Чем robots txt отличается от мета-тега noindex?
Robots.txt через Disallow запрещает сканирование страницы, а мета-тег noindex убирает её из индекса поиска. Это разные задачи: если закрыть страницу в robots.txt, робот не увидит noindex внутри и страница может застрять в выдаче без описания. Для удаления из поиска оставляйте страницу открытой для сканирования и ставьте noindex.
Как закрыть весь сайт от индексации через robots txt?
Добавьте в файл robots.txt в корне сайта две строки: User-agent: * и Disallow: /. Это запрещает сканирование всего сайта всем роботам, что подходит для тестовых и разрабатываемых версий. Для уже проиндексированного боевого сайта одного этого мало, надёжнее закрыть доступ паролем на сервере.
Почему закрытая в robots txt страница всё равно в выдаче Google?
Google запрещает роботу сканировать страницу через Disallow, но может добавить её в индекс по внешним ссылкам, показывая URL без описания. Google официально не поддерживает директиву Noindex внутри robots.txt, поэтому для удаления страницы её оставляют открытой для обхода и закрывают мета-тегом noindex или заголовком X-Robots-Tag.
Что обязательно закрывать в robots txt интернет-магазину?
Магазину стоит закрыть корзину, оформление заказа, личный кабинет, внутренний поиск, страницы сортировок и фильтров с GET-параметрами. Эти разделы создают дубли и съедают краулинговый бюджет, из-за чего робот реже доходит до продающих карточек товаров. Продающие карточки и категории, наоборот, всегда оставляют открытыми.
Как проверить, правильно ли настроен запрет индексации?
Используйте инструмент анализа robots.txt в Яндекс Вебмастере и проверку URL в Google Search Console: они показывают, разрешён обход конкретной страницы или нет. Дополнительно откройте robots.txt по адресу вашсайт/robots.txt в браузере и глазами убедитесь, что там нет случайного Disallow: / на всём сайте.
Можно ли закрыть от индексации только картинки?
Да, через директиву Disallow к папке с изображениями или через маску по расширению вроде /*.jpg$. Но закрывайте только служебную графику, а продающие товарные фото оставляйте открытыми: иначе магазин теряет трафик из поиска по картинкам, где часть покупателей находит товар именно по фото.
Выводы
Robots txt запрет индексации решает две разные задачи, и путать их дорого. Через Disallow вы экономите краулинговый бюджет и убираете из обхода мусорные разделы, а реально удаляете страницу из выдачи мета-тегом noindex или заголовком X-Robots-Tag при открытом сканировании. Полная блокировка Disallow: / подходит для тестовых версий, но для скрытия боевой разработки надёжнее пароль на сервере.
Бизнесу robots.txt важен не сам по себе, а как часть технического фундамента: чистый файл направляет внимание поисковика на страницы, которые приносят заявки, а не на корзину и фильтры. Перед правкой всегда выгружайте реальный список страниц в индексе, проверяйте директивы в Яндекс Вебмастере и не закрывайте вслепую то, что могло бы работать на трафик.
Опубликовано в 2026 году. Проверено на актуальность: подход работает на текущих алгоритмах Яндекса и Google.
