Короткий ответ
Открывать для индексации стоит ту комбинацию фильтров, под которую есть отдельный поисковый запрос, не меньше 10 товаров в выдаче и собственный текст на странице. На практике это один фильтр, иногда два: «кожаные диваны», «диваны угловые». Всё остальное закрывается от обхода, потому что категория с шестью фильтрами по пять значений даёт 46 655 комбинаций одного и того же списка товаров, и краулинговый бюджет уходит именно туда.
Сколько адресов на самом деле рождает каталог
Арифметика здесь важнее теории. Каждый фильтр либо не выбран, либо принимает одно из своих значений, то есть даёт 6 состояний при 5 значениях. Шесть таких фильтров дают 6⁶ = 46 656 состояний, из которых 46 655 отличаются от чистой категории. На 40 категориях это 1,8 млн адресов при 3 000 товаров.
Дальше умножается ещё раз. Адреса ?varv=must&suurus=42 и ?suurus=42&varv=must отдают один и тот же список, но для краулера это два URL. При трёх активных фильтрах перестановки дают 6 вариантов страницы, при четырёх их уже 24. Сортировка и вид списка добавляют свои множители.
Именно поэтому фасетная навигация стоит первой в списке того, что я смотрю, когда в отчёте «Статистика сканирования» видно десятки тысяч запросов в день, а новые товары попадают в индекс через три недели. Как это связано с обходом в целом, я разбирал в статье про краулинговый бюджет.
Что Google советует сам
Это место, где привычный совет расходится с документацией. В руководстве по обходу фасетной навигации (сверено 05.10.2026) Google ставит на первое место robots.txt: «Oftentimes there's no good reason to allow crawling of filtered items, as it consumes server resources for no or negligible benefit». Фильтрация через фрагмент URL после # названа вариантом, который на обход не влияет вообще. А canonical и rel="nofollow" в том же тексте отнесены к методам, «generally less effective in the long term».
| Метод | Что он делает | Что не делает | Когда применяю |
|---|---|---|---|
| Disallow в robots.txt | Останавливает скачивание строки параметров | Не удаляет из индекса уже попавшие адреса | Новый каталог или фильтры, которых в индексе ещё нет |
Фильтр через #фрагмент | Не создаёт отдельных адресов для краулера | Не даёт посадочных страниц под запросы | Служебные фильтры: сортировка, вид списка, наличие |
noindex в meta | Выводит адрес из индекса при следующем обходе | Не экономит обход: страницу всё равно скачивают | Чистка того, что уже проиндексировано |
| Canonical на чистую категорию | Передаёт сигналы родительской странице | Не обязателен к исполнению и не останавливает обход | Параметры сортировки и UTM, где адрес должен работать |
Из этой таблицы следует последовательность, которую чаще всего нарушают: сначала noindex, потом disallow. Если закрыть в robots.txt страницу, которая уже в индексе, краулер её не скачает и noindex на ней не увидит: адрес останется в выдаче со статусом «проиндексировано, несмотря на блокировку в robots.txt», и уйдёт оттуда только после того, как вы снимете disallow и дождётесь обхода. По моим прогонам на клиентских каталогах на это уходит от 2 до 6 недель, то есть ровно столько же, сколько вы пытались сэкономить. Подробнее про механизм и про то, чем он отличается от склейки, в разборе дублей страниц.
Отдельно Google требует двух технических вещей, про которые в русскоязычных руководствах почти не пишут: разделять параметры только знаком &, потому что запятую, точку с запятой и скобки краулеры распознают плохо, и отдавать код 404 для комбинации, которая не вернула ни одного товара.
Правило трёх условий: что открывать
Комбинацию фильтров я открываю, только если выполняются все три условия одновременно: два из трёх не повод. Из тех же 46 655 комбинаций категории проходит отбор обычно 10–20.
- Под неё есть собственный запрос, который люди набирают, — проверяется по Search Console, отчёту поисковых запросов Google Ads и подсказкам выдачи. Для эстонского каталога это отдельная работа, потому что спрос разделён по языкам: как его собирать, я описал в статье про семантическое ядро на эстонском.
- В комбинации не меньше 10 товаров, и это число не падает до нуля при обычных колебаниях наличия. Страница на два товара не удержит посетителя и будет выглядеть тонкой.
- На странице есть хотя бы 2–3 абзаца своего текста, заголовок H1 под запрос и собственное описание в title. Если написать нечего, кроме автоподстановки «Диваны кожаные — 14 товаров», это не посадочная страница, а дубль категории.
Такие страницы перестают быть фильтром и становятся частью структуры: получают ссылку из меню или из блока подкатегорий, попадают в sitemap и в перелинковку. Всё, что в sitemap попало, должно быть индексируемым: противоречие между sitemap и disallow встречается чаще, чем кажется, а при лимите в 50 000 URL на один файл карты закрытые адреса ещё и съедают место под реальные товары. Как это настраивать, в статье про sitemap.xml и robots.txt.
Порядок разбора на живом каталоге
Последовательность, по которой я прохожу каталог, если фильтры уже наплодили адресов:
- Выгрузить из отчёта «Индексирование страниц» все строки со статусами про дубли и «проиндексировано, несмотря на блокировку в robots.txt»: это фактическая картина, а не предположение о том, что в индексе.
- Сгруппировать адреса по набору параметров, а не по категориям: обычно 80 % мусора приходится на два-три параметра вроде сортировки и наличия.
- Отобрать комбинации, проходящие правило трёх условий. На каталоге в 3 000 товаров у меня выходило 15–40 таких страниц на весь сайт, а не на категорию.
- Отобранные превратить в статические разделы с собственным адресом без параметров и поставить на них внутренние ссылки.
- Остальным проставить noindex и дождаться, пока они уйдут из отчёта. На каталоге в несколько десятков тысяч адресов это занимает от 6 до 10 недель, и ускорить это нельзя, кроме отправки в переобход небольшими партиями.
- Только после исчезновения из индекса закрыть набор параметров в robots.txt, чтобы не возвращался.
Шаг 5 остаётся местом, где проекты встают. Заказчик ожидает, что фильтры «закроются за день», а между правкой и чистым отчётом проходят два месяца. Это ожидание дешевле обсудить до начала работ, чем объяснять на пятой неделе.
Чего я не стал бы делать
Две ошибки обходятся дороже всего, и обе выглядят как разумная оптимизация.
Первая ошибка: открыть «на всякий случай» комбинации по двум-трём фильтрам, рассчитывая на длинный хвост. На мебельном каталоге, который я вёл с 2017 года, страницы по одному фильтру приносили трафик, а комбинации по два фильтра собирали единицы заходов в месяц и при этом уводили часть показов у родительской категории. Я их закрыл и описал этот проект подробнее в кейсе мебельного магазина.
Вторая ошибка: ставить canonical с фильтра на чистую категорию и считать вопрос закрытым. Canonical не останавливает обход: краулер продолжит скачивать все 46 655 адресов, а Google вправе с указанием не согласиться. Для сортировки и UTM-параметров это рабочий инструмент, для фасетного пространства не годится.
И честная граница применимости: всё написанное выше про каталоги от 500 до 50 000 товаров. На витрине из 80 позиций фасетная навигация не создаёт проблемы, которую стоит решать: обход там не упирается в лимиты, и время лучше потратить на карточки товаров. На каталогах от 100 000 позиций появляется обратная задача: осознанное построение десятков тысяч посадочных страниц по шаблону, и это другой подход, про который я писал в статье про programmatic SEO.
