Индексация сайта: robots.txt, sitemap, canonical и noindex
Четыре распространенных инструмента решают разные задачи. Ошибка появляется, когда одним пытаются заменить другой или одновременно отправляют поисковику противоречивые сигналы.
robots.txt управляет обходом
Файл указывает, какие пути робот может запрашивать. Запрет обхода не гарантирует исчезновение URL из поиска. Google прямо разделяет управление обходом и блокировку индексации в справке по robots.txt.
Sitemap помогает обнаружению
В XML-карту включайте канонические URL, которые хотите индексировать. Не добавляйте редиректы, страницы с noindex и явные дубли. Карта является подсказкой, а не приказом. Основные правила описаны в документации Sitemap.
Canonical объединяет версии
Он сообщает предпочтительный адрес среди одинаковых или очень похожих страниц. Сигнал должен совпадать с редиректами, внутренними ссылками и картой сайта.
Noindex исключает страницу
Метатег robots или заголовок X-Robots-Tag просит не добавлять страницу в индекс. Чтобы робот увидел noindex, URL нельзя одновременно закрывать от обхода в robots.txt. Это условие отмечено в инструкции Google.
Проверяйте сигналы на уровне конкретного URL, а затем проводите общий технический аудит.
Comments are closed.