Как убрать лишние archive-страницы из индексации в WordPress

На живом WordPress-сайте чаще всего проблема не в одном «плохом» URL, а в пачке архивов, которые поисковик начинает считать отдельными страницами: архивы авторов, дат, тегов, пустых рубрик, страниц пагинации и иногда служебные архивы кастомных таксономий. В результате в индекс попадает много слабых страниц, а канонический контент распыляется.

Ниже разберём, как понять, какие archive-страницы реально мешают, как закрыть их от индексации без поломки сайта и как проверить, что изменения сработали.

Когда archive-страницы становятся проблемой

Не каждый архив нужно закрывать. Если рубрика или таксономия собирает полезный тематический кластер и даёт трафик, её лучше оставить. Но если архив пустой, дублирует ленту записей или существует только потому, что WordPress создал его автоматически, он часто становится техническим мусором.

Типичные симптомы

  • В Google Search Console много страниц с низким качеством и одинаковыми сниппетами.
  • В индексе есть архивы авторов, хотя на сайте один автор или у авторов нет уникального контента.
  • Архивы дат индексируются, хотя по ним нет отдельной ценности.
  • Страницы тегов повторяют рубрики и не дают дополнительной структуры.
  • Пагинация архивов индексируется, но не несёт самостоятельной пользы.

Диагностика: что именно закрывать

Сначала не трогайте всё подряд. Посмотрите, какие URL уже попали в индекс и какие из них реально нужны. Удобно начать с отчёта Страницы в Search Console и выгрузки списка URL из sitemap или краулера.

Проверка вручную тоже полезна: откройте архив и посмотрите, есть ли у него уникальный заголовок, текст, внутренняя перелинковка и смысл для пользователя. Если это просто список записей без дополнительной ценности, такой архив обычно кандидат на noindex.

Полезный ориентир:

  • архив полезен, если он отвечает на отдельный поисковый интент;
  • архив вреден, если он дублирует другие разделы;
  • архив сомнителен, если на нём нет контента кроме списка постов.

Какой способ выбрать: плагин, код или ручная настройка

Для большинства проектов есть три рабочих подхода. Если нужен быстрый и управляемый вариант, проще всего использовать SEO-плагин. Если важна точечная логика и минимальный набор зависимостей, можно добавить код в тему или мини-плагин. Ручная правка robots.txt здесь обычно не лучший выбор: Disallow не равен noindex, и поисковик может продолжать держать URL в индексе без содержимого.

ПодходКогда подходитПлюсыМинусы
SEO-плагинНужно быстро закрыть архивы без кодаПонятно редактору, легко откатитьЗависит от интерфейса плагина
КодНужна точная логика по типам архивовГибко, без лишних настроекНужно тестировать после обновлений
robots.txtТолько для обхода, не для деиндексацииПросто добавитьНе решает задачу индексации полностью

Пошаговое решение через код

Если у вас кастомная тема или небольшой проект, можно закрыть архивы от индексации через wp_robots. Это современный и предсказуемый способ: WordPress добавит нужные директивы в <meta name="robots"> на соответствующих страницах.

Пример: закрываем архивы авторов и дат, а также архивы тегов, если они не несут ценности.

<?php
add_filter( 'wp_robots', function( array $robots ) {
    if ( is_author() || is_date() || is_tag() ) {
        $robots['noindex']  = true;
        $robots['nofollow'] = true;
    }

    return $robots;
} );

Если нужно закрыть только часть архивов, например пустые рубрики или определённые таксономии, логика будет чуть точнее:

<?php
add_filter( 'wp_robots', function( array $robots ) {
    if ( is_category() ) {
        $term = get_queried_object();

        if ( $term instanceof WP_Term ) {
            $count = (int) $term->count;

            if ( $count < 3 ) {
                $robots['noindex']  = true;
                $robots['nofollow'] = true;
            }
        }
    }

    return $robots;
} );

Такой вариант удобен, если вы хотите оставить крупные рубрики в индексе, а мелкие и пустые — убрать. Но не делайте это без проверки: иногда рубрика с небольшим количеством записей всё равно полезна для навигации и поиска.

Если нужен более жёсткий вариант

Иногда одной meta-метки мало, и нужно ещё убрать архив из sitemap. Это уже отдельная задача: закрыть страницу от индексации и не подсовывать её поисковику в карте сайта. Для этого лучше использовать возможности SEO-плагина или фильтры конкретного плагина, а не пытаться «ломать» sitemap вручную.

Настройка через SEO-плагин

Если сайт уже использует SEO-плагин, проверьте настройки архивов в нём. Обычно там можно отдельно отключить индексацию архивов авторов, дат, тегов и некоторых таксономий. Это удобнее для редактора и безопаснее для сопровождения, чем разрозненные правки в теме.

Если на сайте стоит Clearfy Pro, его имеет смысл рассматривать как инструмент для технической чистки и отключения дублей, когда нужно быстро привести архивы и служебные страницы в порядок без ручного кода. Но даже в этом случае сначала проверьте, какие именно архивы он закрывает, чтобы не убрать полезные страницы.

Смысл настройки один: не просто спрятать URL, а убрать из индекса то, что не должно конкурировать с основными страницами сайта.

Проверка результата после внедрения

После изменений не ограничивайтесь просмотром исходного кода. Проверьте несколько уровней:

  • на архивной странице в HTML появился noindex;
  • страница не отдает случайный canonical на другую, нерелевантную страницу;
  • URL больше не добавляется в sitemap, если вы его оттуда убирали;
  • в Search Console статус страницы меняется после повторного обхода;
  • внутренние ссылки на архивы остаются рабочими, если они нужны для навигации.

Для быстрой проверки откройте страницу и посмотрите исходный код браузера или выполните:

curl -I https://example.com/author/admin/

Заголовки ответа не покажут meta robots, но помогут увидеть, нет ли неожиданных редиректов, 404 или проблем с кешем. Саму meta-метку проверяйте через исходный код страницы или инструменты разработчика.

Частые ошибки и как их исправить

Путают noindex и disallow

robots.txt запрещает обход, но не всегда убирает URL из индекса. Если задача именно в деиндексации, используйте noindex на самой странице.

Закрывают всё подряд

Иногда отключают индексацию всех архивов, включая полезные рубрики. В итоге сайт теряет структуру и внутренние точки входа. Перед изменением составьте список архивов и отметьте, какие из них реально дают трафик или помогают навигации.

Оставляют архив в sitemap

Если URL закрыт от индексации, но продолжает попадать в sitemap, поисковик будет снова и снова его обходить. Это не всегда критично, но лишняя нагрузка и шум в отчётах вам не нужны.

Ставят noindex только на шаблон, а не на реальный тип архива

В WordPress один и тот же архив может рендериться разными шаблонами. Проверяйте условные теги, а не только файл темы.

Чек-лист перед публикацией изменений

  • Определены архивы, которые действительно не нужны в индексе.
  • Проверено, что полезные рубрики и таксономии не закрываются случайно.
  • Добавлен noindex на нужные типы архивов.
  • При необходимости архив убран из sitemap.
  • Проверен canonical и отсутствие неожиданных редиректов.
  • Сделана повторная проверка в Search Console после обхода.

Практические советы по безопасности и производительности

Не вносите такие правки прямо в родительскую тему: после обновления они исчезнут. Используйте дочернюю тему или небольшой mu-plugin. Если проект на продакшене и правка точечная, mu-plugin часто надёжнее: логика не зависит от темы и не теряется при редизайне.

Ещё один практический момент: если архивы закрываются из-за дублей, проверьте не только meta robots, но и причину дублей. Часто проблема лежит в структуре контента, тегах без модерации и слишком широких таксономиях. Техническое закрытие — это не замена нормальной архитектуре сайта.

Если нужно быстро навести порядок в служебных страницах, дублях и техническом мусоре, имеет смысл сначала сделать аудит, а потом точечно отключать лишнее. Иначе легко закрыть то, что ещё приносит трафик.

⭐⭐⭐⭐⭐