Где должен лежать robots.txt: протокол, хост, порт и регистр
Файл положили в каталог /seo/robots.txt и ждут блокировки всего домена. Crawler ищет правила только по стандартному адресу в корне сайта.
Используйте корневой путь
Для обычного HTTPS-сайта файл должен открываться по адресу /robots.txt на соответствующем хосте, а имя пути чувствительно к регистру. Другой каталог бесполезен.
Разделяйте области действия
Правила относятся только к протоколу, хосту и порту, где файл размещен, поэтому поддомен, HTTP-версия и нестандартный порт проверяются отдельно. Наследования нет.
Следите за конечным ответом
Google проходит несколько серверных редиректов при получении файла, но длинная цепочка или недоступная цель меняет обработку правил и способна остановить обход. Сократите маршрут.
Составьте список всех индексируемых хостов из Search Console, запросите для каждого точный robots.txt без cookie и сравните фактические правила с теми, которые команда считает опубликованными.
Назначение директив раскрывает материал про robots.txt и индексацию. Источник: спецификация Google.
Comments are closed.