Кэш robots.txt у Google: почему новое правило действует не мгновенно
Администратор снял Disallow и сразу ждет новый обход. Google может продолжать применять предыдущую копию файла из собственного cache.
Закладывайте время
Обычно содержимое robots.txt кэшируется до суток, хотя срок способен меняться по HTTP cache headers и условиям получения. Мгновенности нет.
Не ломайте обновление
Timeout или ответы 5xx мешают скачать новую версию, поэтому Google иногда хранит прежние правила дольше обычного, защищая ранее закрытые пути. Доступность критична.
Проверяйте фактический файл
Контролируйте status, content type, UTF-8 и итоговый текст снаружи инфраструктуры, а не только содержимое в панели CMS. CDN способен отдать старое.
После правки сохраните время развертывания, запросите robots.txt через разные edge-узлы и сопоставьте будущие crawler requests, не делая повторных хаотичных изменений.
Сбои получения разобраны в статье про недоступный robots.txt. Источник: Google Crawling Infrastructure.
Comments are closed.