Тестер Robots.txt

Тестер Robots.txt

Введите URL, чтобы мгновенно проверить, могут ли Googlebot и другие боты сканировать эту страницу по robots.txt.

Что такое Тестер Robots.txt?

Robots.txt — это файл в корне вашего сайта, который сообщает поисковым ботам, какие страницы они могут сканировать. Инструмент оценивает введённый URL по правилам robots.txt сайта и показывает, может ли бот вроде Googlebot сканировать эту страницу и какое правило применяется.

Тестер Robots.txt

Как пользоваться

  1. 1Введите полный URL, который хотите проверить (напр. https://вашсайт.com/private).
  2. 2Выберите бота (по умолчанию: Googlebot) и нажмите «Проверить».
  3. 3Посмотрите результат: сканируется ли страница, какое правило совпало и карты сайта.

Как читать результаты

Разрешено (Allowed)
ДоступноРобот может свободно сканировать страницу. Обратите внимание: разрешение на обход не гарантирует автоматическое попадание страницы в поисковый индекс.
Заблокировано (Blocked)
ЗакрытоДоступ запрещен правилом Disallow. Краулеры не смогут загрузить контент страницы, что критично для продвигаемых разделов сайта.
Заблокировано, но в индексе
ВниманиеБлокировка в robots.txt не удаляет URL из индекса при наличии ссылок. Для гарантированного исключения добавьте директиву noindex в метатеги HTML.
Блокировка CSS и JS
КритичноБлокировка стилей и скриптов мешает ботам корректно отрисовать страницу, что напрямую ухудшает мобильное ранжирование и видимость сайта.
Разные правила для ботов
Проверьте агентовПравило, разрешающее доступ Googlebot, может блокировать Bingbot, Yandex или ботов ИИ. Всегда настраивайте директивы с учетом конкретных краулеров.

Когда использовать

Проверка после релиза

При переносе сайта со staging-сервера легко забыть убрать общее правило Disallow: /. Тестер мгновенно покажет, открыт ли боевой домен для индексации поисковыми роботами.

Настройка фильтров каталога

Проверьте сложные маски директив для URL с сортировкой и фильтрами интернет-магазина. Это гарантирует, что мусорные параметры закрыты, а посадочные страницы категорий доступны ботам.

Закрытие рекламных лендингов

Перед запуском платного трафика убедитесь, что тестовые лендинги закрыты от сканирования. Это сохранит краулинговый бюджет и исключит конкуренцию рекламы с органической выдачей.

Частые ошибки

Использование директивы Noindex

Google официально не поддерживает запись Noindex внутри robots.txt. Подобная строка лишь заблокирует сканирование, но страница все равно попадет в выдачу по внешним ссылкам.

Избыточные спецсимволы масок

Неосторожное использование символов «*» или «?» в директиве Disallow способно случайно закрыть тысячи важных карточек товаров. Каждое регулярное выражение требует точечной проверки.

Размещение в подкаталоге

Файл robots.txt работает исключительно в корне домена. Загрузка файла в поддиректорию вроде site.com/shop/robots.txt игнорируется краулерами — правила оттуда никогда не применятся.

Частые вопросы

Моя страница «Заблокировано» — что делать?

Если вы хотите, чтобы страница появлялась в Google, удалите или сузьте соответствующее правило Disallow в robots.txt. Заблокированные страницы обычно не сканируются.

Если robots.txt блокирует страницу, она никогда не появится в Google?

Robots.txt блокирует сканирование; но URL, на который ссылаются другие сайты, всё равно может быть проиндексирован без сканирования содержимого. Чтобы полностью исключить страницу, используйте мета-тег 'noindex' вместо robots.txt.

Если Allow и Disallow конфликтуют, что побеждает?

В Google побеждает самое длинное (наиболее специфичное) совпавшее правило; при равной длине приоритет у Allow. Этот инструмент применяет ту же логику.

Что если у меня нет robots.txt?

Без robots.txt боты по умолчанию сканируют все страницы. Это не проблема; для большинства небольших сайтов robots.txt не обязателен.

Через сколько Google видит изменения в robots.txt?

Googlebot обычно обновляет кэшированную версию robots.txt каждые 24 часа. Если вам нужно срочно применить обновленные правила или открыть закрытые разделы, отправьте запрос на повторное сканирование через инструмент проверки URL в Google Search Console — бот запросит свежий файл при следующем обращении.

Блокирует ли директива подкаталога все вложенные URL?

Да, директива вроде Disallow: /catalog/ автоматически закрывает от сканирования сам каталог и абсолютно любые пути внутри него, включая файлы и вложенные подпапки. Чтобы открыть конкретный вложенный адрес внутри заблокированного каталога, необходимо прописать точное разрешающее правило с директивой Allow.