Если оставить прежнюю логику, технический хвост продолжал бы расти вместе с каталогом. Но простое закрытие всех фильтров уничтожило бы часть страниц с реальным спросом. Нужна была архитектура, которая отделяет поисковые посадочные от навигационных и технических состояний.
Фильтры каталога: правила вместо миллионов лишних URL
Google уже знал о 65 млн+ неиндексируемых URL, а обход одной крупной категории доходил примерно до 5 млн адресов. Мы изменили не только индексацию, но и саму URL-модель: полезные посадочные получили стабильные ЧПУ вместо параметрических комбинаций, а sitemap перестал отражать технический хвост каталога.
Коротко о кейсеДиагностировал источник разрастания, спроектировал правила по типам страниц, целевую URL-модель и исключения, сформулировал требования и проверил внедрение.
Число неиндексируемых URL, известных Google, сократилось с 65 млн+ до ~1,3 млн. Индекс консолидировался примерно с 500 тыс. до 181 тыс. страниц. Sitemap сократился со 146 файлов по 50 тыс. URL до 4 файлов, а целевые фильтровые посадочные получили аккуратные ЧПУ вместо URL с комбинациями параметров.
Неиндексируемые URL, известные Google, до и после изменения архитектуры.
Решение связывает генерацию страниц, формат URL, правила индексации и sitemap. Именно поэтому эффект измеряется десятками миллионов URL, а не одной локальной чисткой.
Изменилось само правило, по которому URL становится поисковой страницей
Проблема начиналась в генерации страниц и дальше размножалась на обход, индекс, Search Console и sitemap. Поэтому решение затронуло сразу несколько слоёв: какие комбинации вообще получают страницу, какой URL считается целевым, как задаётся SEO-policy и какие адреса объявляются поисковикам через sitemap. ЧПУ и 146 → 4 sitemap-файла — не отдельные косметические улучшения, а следствия одной архитектурной модели.
Автоматическое правило + ручное исключение
Масштабирование требовало стандартного поведения по умолчанию без потери контроля над важными исключениями.
По умолчанию
Тип страницы получает заранее определённое SEO-поведение.
Исключение
Для важных случаев сохраняется ручное управление; модуль теговых страниц поддерживает такие overrides.
Одна категория показала масштаб проблемы
В одной крупной категории техническое пространство доходило примерно до 5 млн открытых URL, хотя полезных поисковых посадочных требовалось на порядки меньше. На уровне сайта Google показывал более 65 млн URL в состоянии «не проиндексировано».
Почему нельзя было просто закрыть все фильтры
Разные типы страниц выполняли разные задачи.
Поисковая посадочная
Нужна, если есть самостоятельный спрос и отдельный интент.
Навигационная страница
Может быть полезна покупателю даже без значимого самостоятельного спроса.
Техническая комбинация
Не должна становиться SEO-сущностью только потому, что URL технически доступен.
URL-модель: параметры → аккуратный ЧПУ
Для страниц, которые действительно заслужили право быть поисковой посадочной, изменили сам формат URL.
До
URL отражал техническую комбинацию фильтров и зависел от параметрической логики интерфейса.
После
Целевая посадочная получает стабильный человекочитаемый ЧПУ и собственное SEO-поведение. Технические комбинации не получают такой статус автоматически.
Как решали, какой фильтр заслуживает отдельной страницы
Решение принималось не по одному параметру.
Семантический спрос
Проверить отдельную группу запросов.
Кластеризация и интент
Понять отдельную задачу пользователя.
Проверка выдачи
Сопоставить предполагаемый тип страницы с реальной поисковой выдачей.
Каннибализация
Не создавать конкурирующую страницу для уже закрытого спроса.
SEO-состояние
После этого определить индексируемость, canonical, crawl policy и формат URL.
Sitemap стал отражать целевой индекс, а не техническое пространство
После очистки URL-архитектуры sitemap перестал быть выгрузкой почти всего, что каталог технически способен сгенерировать.
146 файлов
исторически sitemap был раздроблен на 146 файлов по 50 тыс. URL
4 файла
после очистки остался компактный набор для целевых индексируемых страниц
Смысл изменения
sitemap стал декларацией нужного поискового слоя, а не отражением технического хвоста каталога
Что изменилось в архитектуре
Изменилось само правило, по которому URL получает право стать поисковой страницей.
До
Комбинация есть в интерфейсе → появляется URL → URL может попасть в технический поисковый хвост.
После
Тип страницы → проверка спроса и отличия → SEO-policy → ЧПУ и самостоятельная сущность только при наличии основания.
Моя роль и работа команды
Я отвечал за SEO-архитектуру и критерии; платформенную реализацию выполняла разработка.
Моя работа
Диагностика первопричины, модель поисковых сущностей, критерии, URL-архитектура, sitemap-требования, исключения и UAT.
Работа разработки
Изменение логики каталога, ЧПУ, sitemap и техническая реализация правил.
Контекст и измерение
- Контекст
- Крупный интернет-магазин · реальная работа
- Масштаб / период
- 65 млн+ → ~1,3 млн неиндексируемых URL · ~500 тыс. → 181 тыс. страниц в индексе · 146 → 4 sitemap-файла
Как измеряли
Для результата использованы наблюдаемые технические показатели: неиндексируемые URL, известные Google, размер индекса и число sitemap-файлов после консолидации.
Есть похожая задача?
Расскажите, где SEO упирается в продукт, разработку или данные.