Arutame projekti

Fassettfiltrid: milliseid kombinatsioone indekseerida

Kuus filtrit viie väärtusega annavad ühele kategooriale 46 655 aadressi. Vaatan, millised filtrikombinatsioonid tasub indekseerimiseks avada ja millega ülejäänud sulgeda.

Vladislav Krivorutško5. oktoober 20267 min lugemist
Sisukord

TL;DR — lühidalt peamisest

  • Kategooria kuue filtriga, igal viis väärtust, tekitab 46 655 aadressi — roomamiseelarve kulub neile, mitte uutele toodetele
  • Google'i juhend seab esikohale robots.txt ja URL-i fragmendi, canonical'it ja nofollow'd nimetab pikas plaanis vähem tõhusaks
  • Avada tasub kombinatsioon, millel on oma otsingupäring, vähemalt 10 toodet ja oma tekst — tavaliselt üks filter, harva kaks
  • Juba indekseeritut ei tohi kohe robots.txt-ga sulgeda: robot ei lae lehte alla ega näe seal noindex'it
  • Tühja filtrikombinatsiooni nõuab Google tagastada koodiga 404, parameetrite eraldajana ainult märki „&“

Lühike vastus

Indekseerimiseks tasub avada see filtrikombinatsioon, millel on oma otsingupäring, vähemalt 10 toodet nimekirjas ja oma tekst lehel. Praktikas tähendab see üht filtrit, vahel kaht — „nahkdiivanid“, „nurgadiivanid“. Kõik ülejäänu suletakse roomamise eest, sest kategooria kuue filtriga, igal viis väärtust, annab 46 655 kombinatsiooni samast tootenimekirjast, ja roomamiseelarve kulub just neile.

Mitu aadressi kataloog tegelikult tekitab

Aritmeetika on siin olulisem kui teooria. Iga filter on kas valimata või võtab ühe oma väärtuse, viie väärtuse puhul annab see 6 olekut. Kuus sellist filtrit annavad 6⁶ = 46 656 olekut, millest 46 655 erineb puhtast kategooriast. 40 kategooria peale teeb see 1,8 mln aadressi 3000 toote juures.

Edasi korrutatakse veel kord. Aadressid ?varv=must&suurus=42 ja ?suurus=42&varv=must tagastavad sama nimekirja, kuid roboti jaoks on need kaks URL-i. Kolme aktiivse filtri puhul annavad permutatsioonid 6 lehevarianti, nelja puhul juba 24. Sortimine ja nimekirja vaade lisavad omad kordajad.

Üks kategooria 180 tootega: mitu aadressi näeb GooglebotPuhas kategooria1 aadressVäärivad indekseerimist10–20 aadressi: on päring ja 10+ toodetFiltrikombinatsioonid46 655 aadressi: 6 filtrit 5 väärtusega, 6⁶ olekutParameetrite permutatsioonidegakuni 24× rohkem: järjekord ei ole mallis fikseeritudKombinatsioonide aritmeetika; päringu ja tootearvu lävendid on minu töös kujunenud reegel, mitte Google'i norm

Just seepärast on fassettnavigatsioon esimene asi, mida vaatan, kui aruandes „Roomamise statistika“ on näha kümneid tuhandeid päringuid päevas, uued tooted jõuavad aga indeksisse kolme nädalaga. Kuidas see roomamisega tervikuna seotud on, kirjutasin artiklis roomamiseelarvest.

Mida Google ise soovitab

Siin läheb harjumuspärane nõuanne dokumentatsioonist lahku. Fassettnavigatsiooni roomamise juhendis (kontrollitud 05.10.2026) seab Google esikohale robots.txt: „Oftentimes there's no good reason to allow crawling of filtered items, as it consumes server resources for no or negligible benefit“. Filtreerimine URL-i fragmendi kaudu pärast # on nimetatud variandiks, mis roomamist üldse ei mõjuta. Canonical ja rel="nofollow" on samas tekstis liigitatud meetoditeks, mis on „generally less effective in the long term“.

MeetodMida teebMida ei teeMillal kasutan
Disallow robots.txt-sPeatab parameetririda allalaadimiseEi eemalda indeksist juba sattunud aadresseUus kataloog või filtrid, mida indeksis veel pole
Filter #fragmendi kauduEi tekita robotile eraldi aadresseEi anna maandumislehti päringute allTeenindusfiltrid: sortimine, vaade, laoseis
noindex metasildisViib aadressi järgmise roomamise järel indeksist väljaEi säästa roomamist: leht laaditakse ikka allaJuba indekseeritu koristamine
Canonical puhtale kategoorialeAnnab signaalid emalehele edasiEi ole täitmiseks kohustuslik ega peata roomamistSortimisparameetrid ja UTM, kus aadress peab töötama

Sellest tabelist järeldub järjekord, mida kõige sagedamini rikutakse: esmalt noindex, siis disallow. Kui sulgeda robots.txt-s leht, mis on juba indeksis, siis robot seda alla ei lae ega näe seal noindex'it: aadress jääb otsingusse staatusega „indekseeritud, kuigi robots.txt blokeerib“ ja lahkub sealt alles siis, kui disallow maha võtate ja roomamise ära ootate. Minu läbikäikudes klientide kataloogides on selleks kulunud 2 kuni 6 nädalat ehk täpselt see aeg, mida püüdsite kokku hoida. Täpsemalt sellest mehhanismist ja selle erinevusest kokkuliitmisest kirjutasin duplikaatsisu käsitluses.

Eraldi nõuab Google kaht tehnilist asja, millest eestikeelsetes juhendites peaaegu ei kirjutata: eraldada parameetrid ainult märgiga &, sest koma, semikoolonit ja sulge tunnevad robotid halvasti ära, ning tagastada kood 404 kombinatsioonile, mis ühtegi toodet ei andnud.

Kolme tingimuse reegel: mida avada

Filtrikombinatsiooni avan ainult siis, kui kõik kolm tingimust kehtivad korraga: kaks kolmest ei ole põhjus. Samast 46 655 kombinatsioonist läbib valiku tavaliselt 10–20.

  1. Sellel on oma päring, mida inimesed sisestavad — kontrollitav Search Console'i, Google Adsi otsingupäringute aruande ja otsingusoovituste järgi. Eesti kataloogi puhul on see omaette töö, sest nõudlus jaguneb keelte vahel: kuidas seda koguda, kirjeldasin artiklis märksõnade uuringust eesti keeles.
  2. Kombinatsioonis on vähemalt 10 toodet ja see arv ei kuku laoseisu tavapärasel kõikumisel nulli. Kahe tootega leht külastajat ei hoia ja näeb õhuke välja.
  3. Lehel on vähemalt 2–3 lõiku oma teksti, H1 päringu all ja oma kirjeldus title'is. Kui kirjutada pole midagi peale automaatse „Nahkdiivanid — 14 toodet“, ei ole see maandumisleht, vaid kategooria duplikaat.

Sellised lehed lõpetavad filtri olemise ja saavad struktuuri osaks: nad saavad lingi menüüst või alamkategooriate plokist, jõuavad sitemap'i ja siselinkimisse. Kõik, mis sitemap'i jõudis, peab olema indekseeritav: vastuolu sitemap'i ja disallow'i vahel esineb sagedamini kui arvatakse, ning ühe sitemap-faili 50 000 URL-i piiri juures söövad suletud aadressid lisaks ära koha, mida vajavad reaalsed tooted. Kuidas seda seadistada, käsitlesin artiklis sitemap.xml ja robots.txt artiklis.

Elava kataloogi läbivaatamise järjekord

Järjekord, mille järgi 3000 tootega kataloogi läbin, kui filtrid on aadresse juba juurde tekitanud:

  1. Laadida aruandest „Lehtede indekseerimine“ välja kõik read duplikaadistaatustega ja staatusega „indekseeritud, kuigi robots.txt blokeerib“: see on tegelik pilt, mitte oletus selle kohta, mis indeksis on.
  2. Rühmitada aadressid parameetrite komplekti, mitte kategooriate järgi: tavaliselt langeb 80 % prügist kahe-kolme parameetri peale, näiteks sortimine ja laoseis.
  3. Valida välja kombinatsioonid, mis läbivad kolme tingimuse reegli. 3000 tootega kataloogis on mul tulnud 15–40 sellist lehte kogu saidi, mitte kategooria peale.
  4. Valitud muuta staatilisteks osadeks oma aadressiga ilma parameetriteta ja panna neile siselingid.
  5. Ülejäänutele panna noindex ja oodata, kuni nad aruandest kaovad. Mõnekümne tuhande aadressiga kataloogis võtab see 6–10 nädalat ja kiirendada ei saa, välja arvatud väikeste partiide kaupa uuesti roomamisele saatmine.
  6. Alles pärast indeksist kadumist sulgeda parameetrite komplekt robots.txt-s, et see tagasi ei tuleks.

Samm 5 on koht, kus projektid seisma jäävad. Tellija ootab, et filtrid „suletakse päevaga“, parandusest puhta aruandeni läheb aga kaks kuud. Seda ootust on odavam arutada enne tööde algust kui selgitada viiendal nädalal.

Mida ma ei teeks

Kaks viga maksavad kõige rohkem kätte ja mõlemad näevad välja nagu mõistlik optimeerimine: mõlemad olen ise 2017. aastast alates mööblikataloogis läbi teinud.

Esimene viga on avada „igaks juhuks“ kahe-kolme filtri kombinatsioonid, lootes pikale sabale. Mööblikataloogis, mida olen vedanud 2017. aastast, tõid ühe filtri lehed liiklust, kahe filtri kombinatsioonid kogusid aga üksikuid külastusi kuus ja võtsid emakategoorialt osa näitamisi ära. Sulgesin need ja kirjutasin projektist pikemalt mööblipoe juhtumis.

Teine viga on panna filtrilt canonical puhtale kategooriale ja lugeda küsimus lahendatuks. Canonical ei peata roomamist: robot laeb kõik 46 655 aadressi edasi alla ja Google'il on õigus juhisega mitte nõustuda. Sortimise ja UTM-parameetrite jaoks on see töötav tööriist, fassettruumi jaoks aga ei sobi.

Ja aus kehtivuspiir: kõik ülaltoodu käib kataloogide kohta 500 kuni 50 000 tootega. 80 artikliga poes ei tekita fassettnavigatsioon probleemi, mida tasuks lahendada: roomamine ei põrku seal piiridesse ja aeg kulub paremini tootekaartidele. Alates 100 000 artiklist tekib vastupidine ülesanne, nimelt teadlikult ehitada malli järgi kümneid tuhandeid maandumislehti, ja see on teine lähenemine, millest kirjutasin artiklis programmaatilisest SEO-st.

Korduma kippuvad küsimused

Mitu filtrikombinatsiooni võib indekseerimiseks avada?
Keskmises e-poes on see 10–20 lehte kategooria kohta, pea alati ühe filtri järgi ja harva kahe. Kriteerium ei ole arv, vaid oma päringu olemasolu: „nahkdiivan“ otsitakse, „hall nahkdiivan 180 cm laos“ mitte. Avatud leht ilma päringuta liiklust ei too, kuid kulutab roomamist ja konkureerib emakategooriaga.
Millega filtreid sulgeda: robots.txt, noindex või canonical?
Google'i fassettnavigatsiooni juhend seab robots.txt ja URL-i fragmendi otsesõnu esikohale, canonical'it ja rel=nofollow nimetab aga pikas plaanis üldiselt vähem tõhusaks. Praktiline reegel: indeksisse mittejõudnu suletakse robots.txt-ga, juba indekseeritu saab esmalt noindex'i kuni kadumiseni aruandest „Lehtede indekseerimine“ ja alles siis disallow'i.
Miks ei või lihtsalt kõik parameetrid robots.txt-s keelata?
Sest keelatud aadressi robot alla ei lae ega näe seal ei noindex'it ega canonical'it. Aadress jääb indeksisse staatusega „indekseeritud, kuigi robots.txt blokeerib“, tihti ilma kirjelduseta otsingutulemuses. Robots.txt säästab roomamist, aga ei eemalda indeksist — need on kaks eri ülesannet.
Kas parameetrite järjekord URL-is tekitab duplikaate?
Jah, ja rohkem kui tundub. Aadressid ?varv=must&suurus=42 ja ?suurus=42&varv=must tagastavad sama nimekirja, kuid on kaks eri URL-i. Kolme korraga aktiivse filtri puhul annab järjekord 6 varianti samast lehest, nelja puhul 24. Seepärast fikseeritakse parameetrite järjekord malli tasemel, mitte ei jäeta selle hooleks, mis järjekorras külastaja linnukesi klõpsis.
Mida tagastada, kui filtrikombinatsiooni all tooteid ei ole?
Google nõuab samas juhendis koodi 404 kombinatsiooni puhul, mis tulemusi ei tagasta. Kõige sagedasem viga on tagastada 200 ja tühi leht tekstiga „midagi ei leitud“: otsingu jaoks on see tuhandeid õhukesi ühesuguseid lehti. Kui kombinatsioon on ajutiselt tühi ja on maandumisleht päringu all, on parem näidata naaberrühma tooteid ja öelda sellest nimekirja pealkirjas ausalt välja.

Järeldused

Fassettnavigatsioon ei ole ülesanne „sulge filtrid indekseerimise eest“, vaid ülesanne jagada kataloog kaheks: kümmekond maandumislehte reaalse nõudluse all ja kõik ülejäänu, mida robot nägema ei pea. Piiri tõmbab kolm kontrollitavat tingimust: on päring, on vähemalt 10 toodet, on oma sõnadega midagi kirjutada. Kui kataloog on juba laiali valgunud ja pole selge, kust otsast alustada, on see osa tööst, mida teen [SEO-optimeerimise](/et/seo-optimeerimine) raames, ning aadresside moodustamise reeglid tuleb enamasti parandada [kataloogi arenduse](/et/veebiarendus) tasemel.

Artikli autor

Vladislav Krivorutško — ADLABi asutaja
Vladislav Krivorutško

ADLAB OÜ asutaja · SEO ja Google Ads

Üle 20 aasta otsiliikluse ja monetiseerimisega, Eesti turul alates 2017. aastast. Töötan üksi: teen auditi, koostan strateegia ja viin projekti ise lõpuni — ilma alltöövõtjate ja šabloonideta. Kirjutan ainult sellest, mida olen oma ja klientide saitidel järele proovinud.

  • 20+ aastat otsiliikluses
  • 50+ projekti võtmed kätte
  • Oma saidid konkurentsitihedates nišides
  • SEO ru/et/en ühes otsingutulemuses
Loe minust lähemalt

Loe edasi