Обсудить проект

Фасетные фильтры: какие комбинации открывать для индексации

Шесть фильтров по пять значений дают 46 655 адресов одной категории. Разбираю, какие комбинации фильтров стоит индексировать, а какие закрывать и чем именно.

Vladislav Krivorutško5 октября 2026 г.8 мин чтения
Содержание

TL;DR — коротко о главном

  • Категория с шестью фильтрами по пять значений порождает 46 655 адресов — краулинговый бюджет уходит туда, а не на новые товары
  • Google в своём руководстве ставит на первое место robots.txt и фрагменты URL, а canonical и nofollow называет «менее эффективными в долгую»
  • Открывать стоит комбинацию, у которой есть собственный запрос, не меньше 10 товаров и отдельный текст — обычно это один-два фильтра, не три
  • Уже проиндексированное нельзя закрывать сразу robots.txt: краулер не скачает страницу и не увидит на ней noindex
  • Пустую комбинацию фильтров Google требует отдавать кодом 404, а параметры разделять только знаком «&»

Короткий ответ

Открывать для индексации стоит ту комбинацию фильтров, под которую есть отдельный поисковый запрос, не меньше 10 товаров в выдаче и собственный текст на странице. На практике это один фильтр, иногда два: «кожаные диваны», «диваны угловые». Всё остальное закрывается от обхода, потому что категория с шестью фильтрами по пять значений даёт 46 655 комбинаций одного и того же списка товаров, и краулинговый бюджет уходит именно туда.

Сколько адресов на самом деле рождает каталог

Арифметика здесь важнее теории. Каждый фильтр либо не выбран, либо принимает одно из своих значений, то есть даёт 6 состояний при 5 значениях. Шесть таких фильтров дают 6⁶ = 46 656 состояний, из которых 46 655 отличаются от чистой категории. На 40 категориях это 1,8 млн адресов при 3 000 товаров.

Дальше умножается ещё раз. Адреса ?varv=must&suurus=42 и ?suurus=42&varv=must отдают один и тот же список, но для краулера это два URL. При трёх активных фильтрах перестановки дают 6 вариантов страницы, при четырёх их уже 24. Сортировка и вид списка добавляют свои множители.

Одна категория на 180 товаров: сколько адресов видит GooglebotЧистая категория1 адресЗаслуживают индексации10–20 адресов: есть запрос и 10+ товаровКомбинации фильтров46 655 адресов: 6 фильтров по 5 значений, 6⁶ состоянийС перестановками параметровдо 24× больше: порядок параметров не зафиксирован в шаблонеАрифметика комбинаций; пороги по запросу и числу товаров — моё рабочее правило, не норма Google

Именно поэтому фасетная навигация стоит первой в списке того, что я смотрю, когда в отчёте «Статистика сканирования» видно десятки тысяч запросов в день, а новые товары попадают в индекс через три недели. Как это связано с обходом в целом, я разбирал в статье про краулинговый бюджет.

Что Google советует сам

Это место, где привычный совет расходится с документацией. В руководстве по обходу фасетной навигации (сверено 05.10.2026) Google ставит на первое место robots.txt: «Oftentimes there's no good reason to allow crawling of filtered items, as it consumes server resources for no or negligible benefit». Фильтрация через фрагмент URL после # названа вариантом, который на обход не влияет вообще. А canonical и rel="nofollow" в том же тексте отнесены к методам, «generally less effective in the long term».

МетодЧто он делаетЧто не делаетКогда применяю
Disallow в robots.txtОстанавливает скачивание строки параметровНе удаляет из индекса уже попавшие адресаНовый каталог или фильтры, которых в индексе ещё нет
Фильтр через #фрагментНе создаёт отдельных адресов для краулераНе даёт посадочных страниц под запросыСлужебные фильтры: сортировка, вид списка, наличие
noindex в metaВыводит адрес из индекса при следующем обходеНе экономит обход: страницу всё равно скачиваютЧистка того, что уже проиндексировано
Canonical на чистую категориюПередаёт сигналы родительской страницеНе обязателен к исполнению и не останавливает обходПараметры сортировки и UTM, где адрес должен работать

Из этой таблицы следует последовательность, которую чаще всего нарушают: сначала noindex, потом disallow. Если закрыть в robots.txt страницу, которая уже в индексе, краулер её не скачает и noindex на ней не увидит: адрес останется в выдаче со статусом «проиндексировано, несмотря на блокировку в robots.txt», и уйдёт оттуда только после того, как вы снимете disallow и дождётесь обхода. По моим прогонам на клиентских каталогах на это уходит от 2 до 6 недель, то есть ровно столько же, сколько вы пытались сэкономить. Подробнее про механизм и про то, чем он отличается от склейки, в разборе дублей страниц.

Отдельно Google требует двух технических вещей, про которые в русскоязычных руководствах почти не пишут: разделять параметры только знаком &, потому что запятую, точку с запятой и скобки краулеры распознают плохо, и отдавать код 404 для комбинации, которая не вернула ни одного товара.

Правило трёх условий: что открывать

Комбинацию фильтров я открываю, только если выполняются все три условия одновременно: два из трёх не повод. Из тех же 46 655 комбинаций категории проходит отбор обычно 10–20.

  1. Под неё есть собственный запрос, который люди набирают, — проверяется по Search Console, отчёту поисковых запросов Google Ads и подсказкам выдачи. Для эстонского каталога это отдельная работа, потому что спрос разделён по языкам: как его собирать, я описал в статье про семантическое ядро на эстонском.
  2. В комбинации не меньше 10 товаров, и это число не падает до нуля при обычных колебаниях наличия. Страница на два товара не удержит посетителя и будет выглядеть тонкой.
  3. На странице есть хотя бы 2–3 абзаца своего текста, заголовок H1 под запрос и собственное описание в title. Если написать нечего, кроме автоподстановки «Диваны кожаные — 14 товаров», это не посадочная страница, а дубль категории.

Такие страницы перестают быть фильтром и становятся частью структуры: получают ссылку из меню или из блока подкатегорий, попадают в sitemap и в перелинковку. Всё, что в sitemap попало, должно быть индексируемым: противоречие между sitemap и disallow встречается чаще, чем кажется, а при лимите в 50 000 URL на один файл карты закрытые адреса ещё и съедают место под реальные товары. Как это настраивать, в статье про sitemap.xml и robots.txt.

Порядок разбора на живом каталоге

Последовательность, по которой я прохожу каталог, если фильтры уже наплодили адресов:

  1. Выгрузить из отчёта «Индексирование страниц» все строки со статусами про дубли и «проиндексировано, несмотря на блокировку в robots.txt»: это фактическая картина, а не предположение о том, что в индексе.
  2. Сгруппировать адреса по набору параметров, а не по категориям: обычно 80 % мусора приходится на два-три параметра вроде сортировки и наличия.
  3. Отобрать комбинации, проходящие правило трёх условий. На каталоге в 3 000 товаров у меня выходило 15–40 таких страниц на весь сайт, а не на категорию.
  4. Отобранные превратить в статические разделы с собственным адресом без параметров и поставить на них внутренние ссылки.
  5. Остальным проставить noindex и дождаться, пока они уйдут из отчёта. На каталоге в несколько десятков тысяч адресов это занимает от 6 до 10 недель, и ускорить это нельзя, кроме отправки в переобход небольшими партиями.
  6. Только после исчезновения из индекса закрыть набор параметров в robots.txt, чтобы не возвращался.

Шаг 5 остаётся местом, где проекты встают. Заказчик ожидает, что фильтры «закроются за день», а между правкой и чистым отчётом проходят два месяца. Это ожидание дешевле обсудить до начала работ, чем объяснять на пятой неделе.

Чего я не стал бы делать

Две ошибки обходятся дороже всего, и обе выглядят как разумная оптимизация.

Первая ошибка: открыть «на всякий случай» комбинации по двум-трём фильтрам, рассчитывая на длинный хвост. На мебельном каталоге, который я вёл с 2017 года, страницы по одному фильтру приносили трафик, а комбинации по два фильтра собирали единицы заходов в месяц и при этом уводили часть показов у родительской категории. Я их закрыл и описал этот проект подробнее в кейсе мебельного магазина.

Вторая ошибка: ставить canonical с фильтра на чистую категорию и считать вопрос закрытым. Canonical не останавливает обход: краулер продолжит скачивать все 46 655 адресов, а Google вправе с указанием не согласиться. Для сортировки и UTM-параметров это рабочий инструмент, для фасетного пространства не годится.

И честная граница применимости: всё написанное выше про каталоги от 500 до 50 000 товаров. На витрине из 80 позиций фасетная навигация не создаёт проблемы, которую стоит решать: обход там не упирается в лимиты, и время лучше потратить на карточки товаров. На каталогах от 100 000 позиций появляется обратная задача: осознанное построение десятков тысяч посадочных страниц по шаблону, и это другой подход, про который я писал в статье про programmatic SEO.

Частые вопросы

Сколько комбинаций фильтров можно открывать для индексации?
На среднем магазине это 10–20 страниц на категорию, почти всегда по одному фильтру и редко по двум. Критерий не количество, а наличие собственного запроса: «nahkdiivan» или «кожаный диван» спрашивают, «кожаный диван серый 180 см в наличии» — нет. Открытая страница без запроса не приносит трафика, но тратит обход и конкурирует с родительской категорией.
Чем закрывать фильтры: robots.txt, noindex или canonical?
Google в руководстве по фасетной навигации прямо ставит robots.txt и фрагменты URL на первое место, а canonical и rel=nofollow называет «в долгую, как правило, менее эффективными». Практическое правило: не попавшее в индекс закрывается robots.txt, уже проиндексированное — сначала noindex до исчезновения из отчёта «Индексирование страниц», и только потом disallow.
Почему нельзя просто запретить все параметры в robots.txt?
Потому что запрещённую строку краулер не скачивает, а значит, не видит на ней ни noindex, ни canonical. Адрес остаётся в индексе со статусом «проиндексировано, несмотря на блокировку в robots.txt», часто без описания в сниппете. Robots.txt экономит обход, но не удаляет из индекса — это две разные задачи.
Влияет ли порядок параметров в URL на дубли?
Да, и сильнее, чем кажется. Адреса ?varv=must&suurus=42 и ?suurus=42&varv=must отдают одинаковый список, но это два разных URL. При трёх одновременно активных фильтрах порядок даёт 6 вариантов одной страницы, при четырёх — 24. Поэтому порядок параметров фиксируется на уровне шаблона, а не оставляется на то, в каком порядке посетитель щёлкал по чекбоксам.
Что отдавать, если под комбинацию фильтров нет товаров?
Google в том же руководстве требует код 404 для комбинации, которая не возвращает результатов. Самая частая ошибка — отдавать 200 и пустую страницу с текстом «ничего не найдено»: для поиска это тысячи тонких почти одинаковых страниц. Если комбинация пустая временно и является посадочной под запрос, лучше показать товары соседней группы и честно сказать об этом в заголовке списка.

Выводы

Фасетная навигация — это не задача «закрыть фильтры от индексации», а задача разделить каталог на две части: десяток-полтора посадочных страниц под реальный спрос и всё остальное, что краулеру видеть не нужно. Границу проводит не вкус, а три проверяемых условия: есть запрос, есть минимум 10 товаров, есть что написать на странице своими словами. Если каталог уже разросся и непонятно, с какого конца разбирать, это часть работы, которую я делаю в рамках [SEO-продвижения](/seo), а правила формирования адресов обычно приходится править на уровне [разработки каталога](/web-razrabotka).

Автор статьи

Владислав Криворучко — основатель ADLAB
Владислав Криворучко

Основатель ADLAB OÜ · SEO и Google Ads

Больше 20 лет в поисковом трафике и монетизации, на эстонском рынке — с 2017 года. Работаю один: сам провожу аудит, строю стратегию и веду проекты — без подрядчиков и шаблонов. Пишу только о том, что проверил на своих и клиентских сайтах.

  • 20+ лет в поисковом трафике
  • 50+ проектов под ключ
  • Собственные сайты в конкурентных нишах
  • SEO для ru/et/en в одной выдаче
Подробнее обо мне

Читать дальше