Lühike vastus
Lehed ei indekseeru Google'is ühel kahest põhjuste rühmast: kas oled indekseerimise ise tehniliselt keelanud (see on üks osa sellest, mida katab veebilehe tehniline optimeerimine) või on Google otsustanud, et leht ei ole piisavalt väärtuslik, et talle indeksis kohta anda. Esimene rühm saab korda ühe õhtuga, teine võtab nädalaid tööd sisu ja struktuuriga.
Oluline täpsustus, mis maandab poole ärevusest: indekseerimine ei ole garanteeritud. Google ütleb otse, et ei luba indekseerida kõiki saidi lehti — see on normaalne tööseisund, mitte rike. Täpse põhjuse iga URL-i kohta näitab Search Console'i aruanne Lehtede indekseerimine ja alustada tulebki ainult sealt.
Kuidas leida tegelik põhjus, mitte oletada
Järjekord on täpselt selline:
- Ava Search Console → Indekseerimine → Lehed. All on põhjuste loend koos URL-ide arvuga iga rea kohta.
- Leia oma lehed sellest loendist ja vaata staatuse sõnastust. See ongi diagnoos.
- Konkreetse URL-i jaoks kasuta ülal olevat URL-i kontrolli tööriista: see näitab, kas aadress on Google'ile teada, millal seda roomati, millise canonical'i Google valis ja mida roomaja näeb.
- Vajuta URL-i kontrollis nuppu, mis testib lehte otse saidil — see näitab renderdatud HTML-i. Kasulik siis, kui sisu laaditakse skriptidega ja roomaja näeb tühja lehte.
Üks nõuanne praktikast: ära vaata indekseeritud lehtede koguarvu. See erineb peaaegu alati sinu ettekujutusest saidi suurusest, sest sinna satuvad ka tehnilised URL-id, ja eraldi võetuna ei tähenda see midagi. Vaata põhjuste kaupa.
Mida Search Console'i staatused tähendavad
| Staatus | Mis juhtus | Kas see on probleem? |
|---|---|---|
| Avastatud, kuid pole indekseeritud | URL on teada, aga pole roomatud | Jah, prioriteedi ja väärtuse küsimus |
| Roomatud, kuid pole indekseeritud | Leht loeti läbi ja jäeti indeksist välja | Jah, sisu kvaliteedi küsimus |
| Ümbersuunamisega leht | URL vastab 301 või 302 | Ei, kui ümbersuunamine on tahtlik |
| Blokeeritud robots.txt-failiga | Roomamine on keelatud | Jah, kui keeld on juhuslik |
| Leht sisaldab noindex-silti | Otsene indekseerimiskeeld | Jah, kui silt pole sinu pandud |
| Alternatiivne leht korrektse canonical'iga | Google valis peamiseks teise URL-i | Ei, kui canonical on õige |
| Duplikaat: Google valis teise canonical'i | Sinu canonical jäeti arvestamata | Jah, nõrga unikaalsuse märk |
| Ei leitud (404) | Lehte pole olemas | Ei, kui kustutasid selle meelega |
| Serveri viga (5xx) | Server ei tagastanud lehte | Jah, paranda esimesena |
Eraldi kahest kõige sagedasemast reast. Avastatud, kuid pole indekseeritud ja Roomatud, kuid pole indekseeritud hirmutavad kõige rohkem, kuid just need tähendavad, et tehnilist keeldu ei ole. Google näeb URL-i ja otsustab sellele ressurssi mitte kulutada. See ei ole rike, mida otsida, vaid hinnang, mida muuta.
Tehnilised põhjused: paranevad ühe õhtuga
Loend on lühike, aga see tuleb üle käia enne kõike muud — sest kuni keeld kehtib, ei aita mingi sisutöö.
- Noindex-metasilt. Kõige sagedasem lugu: sait ehiti arenduskeskkonnas indekseerimine kinni, viidi live'i ja unustati linnuke ära võtta. WordPressis on see lugemise seadetes valik, mis palub otsimootoritel saiti mitte indekseerida. Kontrolli, otsides lehe lähtekoodist sõna
noindex. - Keeld robots.txt-is. Ava
sinu-sait.ee/robots.txtja veendu, et seal ei oleDisallow: /. Ja pea meeles lõksu: robots.txt-iga suletud lehte ei roomata, seega ei näe Google seal olevat noindex-silti, kui sa selle sinna panid. - Canonical teisele URL-ile. Kui lehel on
rel="canonical"teise lehe aadressiga, oled ise Google'ile öelnud, et see leht on teisejärguline. Suurtel saitidel on see sageli malli vale seadistuse tagajärg, kus terve rubriik kanoniseeritakse kategooriale. Mitmekeelsetel saitidel kanoniseerib sama mall mittepõhilised keeleversioonid põhiversioonile — selle stsenaariumi võtsin lahti artiklis hreflangi seadistamisest ja levinud vigadest. - HTTP-staatus. Leht peab vastama koodiga 200. Kontrolli, et ei oleks ümbersuunamiste ahelat, elava sisu juures 404-t ega koormuse all tekkivaid 5xx-vigu.
- Puudumine saidikaardilt ja siselinkidest. Leht, millele ei vii ühtegi linki saidilt ja mida pole sitemap'is, on roomaja jaoks peaaegu olematu.
- Sisu ainult JavaScriptis. Google oskab JS-i renderdada, kuid teeb seda teises järjekorras ja mitte alati lõpuni. Kui renderdatud HTML-is on teksti asemel tühjus, indekseerub leht halvasti.
Eraldi rida on serveri stabiilsus. Google ütleb, et aeglaste vastuste ja vigade korral vähendab ta roomamise sagedust. Sellest kirjutasin ka analüüsis, kas saidi kiirus mõjutab positsioone: väikesele saidile see suurt ei loe, kümnete tuhandete URL-idega poele on kriitiline. Kolimist ise aga karta ei tasu: majutuse vahetus ei halvenda SEO-d, kui migratsioon on tehtud korrektselt ja ümbersuunamised on paigas.
Kvaliteedipõhised põhjused: paranevad nädalatega
Kui tehnilisi keelde ei ole ja lehed seisavad staatuses Avastatud, kuid pole indekseeritud, käib jutt väärtusest. Mis päriselt töötab:
- Unikaalne mõte, mitte unikaalne tekst. Leht, mis jutustab ümber seda, mis on indeksis juba kahekümnes variandis, ei anna Google'ile põhjust lisada kahekümne esimest. Vaja on oma nurka: oma andmeid, oma kogemust, oma vastuse ülesehitust.
- Siselingid. Sissetulevate linkideta leht näeb välja nagu mustand. Anna sellele link asjakohasest rubriigist või artiklist — sageli piisab ainuüksi sellest, et URL liiguks avastatud seisundist indeksisse.
- Vähem lehti, aga tihedamalt. Kümme tühja lehte lähisünonüümide alla töötavad halvemini kui üks põhjalik. See maandab ka kannibaliseerimise riski, mille vastu aitab korralik SEO-optimeerimine, kui kaks lehte võistlevad sama päringu pärast ja mõlemad kaotavad.
- Genereeritud URL-ide kontroll. Filtrid, sorteerimised, lehekülgede jaotus ja parameetrid loovad tuhandeid aadresse, mis söövad roomamise limiiti. Need tuleb sulgeda noindex-siltiga või kanoniseerida — siis jõuab roomaja vajalike lehtedeni kiiremini.
- Saidi üldine värskus. Regulaarselt uuenevatel saitidel indekseeruvad uued lehed märgatavalt kiiremini kui seisma jäänutel. Sama tähelepanek on hästi näha mitmekeelsetes projektides — kirjutasin sellest artiklis, mis keeles veebilehte Eestis turundada.
Kuidas uue lehe indekseerimist kiirendada
Lehe avastamist saab tõesti kiirendada, kuid piir tuleb selgelt paika panna: iga kiirendusvahend mõjutab seda, kui ruttu Googlebot lehele jõuab, mitte otsust seda indeksisse võtta. Nõrga lehe puhul jõuad kiirendusega lihtsalt kiiremini keeldumiseni.
URL-i käsitsi saatmine Search Console'is. Kõige lihtsam ja tasuta viis. Ava URL-i kontrolli tööriist, kleebi aadress ja vajuta indekseerimise taotlemise nuppu — Google paneb URL-i eelisjärjekorda ja uus roomamine toimub tavaliselt tundide või päevadega, mitte nädalatega. See on standardsamm iga uue lehe avaldamise ja iga olulise muudatuse järel. Piirangud: päevane kvoot taotluste arvule ja sama URL-i korduv saatmine midagi juurde ei anna — järjekord on üks.
Telegrami bot @BoostIndexBot. Töötab Google'i indekseerimise API kaudu: annad botile URL-ide nimekirja, tema saadab need otse roomamisjärjekorda ja näitab iga lingi staatust. Minu kogemuse põhjal jõuavad kvaliteetsed uued lehed pärast sellist saatmist indeksisse ööpäeva jooksul — märgatavalt kiiremini kui tavalist roomamist oodates. Märksõna on siin kvaliteetsed: lehti, mida Google niikuinii võtta ei kavatsenud, bot indeksisse ei suru. Ta kiirendab roomamist, ei tühista hinnangut.
Praktikas on kõige mugavam kombinatsioon: uute URL-ide masssaatmine käib läbi @BoostIndexBot ja Search Console jääb konkreetsete aadresside punktkontrolliks ja diagnostikaks — sealt on ka näha, mille Google lõpuks otsustas.
Mida kiirendamine ei tee: ei tõsta positsioone, ei asenda siselinke ega päästa õhukesi lehti. Kui leht jõudis indeksisse ööpäevaga ja kuu aja pärast kukkus sealt välja, oli probleem sisus, mitte roomamise kiiruses.
Mida ma oma projektides näen
Põhiline osa mu sissetulekust tuleb enda saitidelt konkurentsitihedates nišides ja indekseerimise pilt on seal üsna ühetaoline: elavatel, regulaarselt uuenevatel projektidel jõuavad uued materjalid indeksisse ise ja kiiresti, hüljatud saitidel võivad täpselt samad tekstid seista avastatud staatuses kuid. Vahe ei ole tekstides, vaid selles, kas roomaja üldse saidil käib.
Teine tähelepanek on massilehtede kohta. Iga kord, kui olen genereerinud suure hulga ühetaolisi lehti madalsageduslike päringute alla, on osa neist Google'il lihtsalt vastu võtmata jäänud. Ei karistanud, ei eemaldanud indeksist olemasolevat — ignoreeris vaikselt uusi. Sellest tegin praktilise järelduse: lehtede arvu tasub kasvatada aeglasemalt, kui tehnika lubaks.
Ausad piirid. Kõik eelnev käib teenusesaitide, väikepoodide ja sisuprojektide kohta — see tähendab tüüpilise Eesti väikeettevõtte ja minu enda projektide kohta. Sadade tuhandete URL-idega saitidel tõuseb esiplaanile roomamise eelarve loogika ja seal on prioriteedid teised: serverilogid, roomamise limiidid, fassettnavigatsiooni käsitlemine. Sellises mahus omi andmeid mul ei ole, seega ma neist ka ei kirjuta.
Ja ausalt tähtaegadest. Roomamist saab kiirendada ja ülalkirjeldatud vahendid seda teevadki. Mida teha ei saa, on sundida Google'it indeksisse võtma lehte, mida ta võtta ei taha. Vahe on põhimõtteline: URL-i saatmine lühendab ootuse nädalatelt ööpäevale lehe puhul, mis oleks valiku niikuinii läbinud, kuid ei muuda otsust nõrga lehe kohta. Seega kui sulle lubatakse raha eest ükskõik milliste lehtede garanteeritud indekseerimist, on jutt kas sellest, mis oleks niikuinii juhtunud, või skeemidest, mille eest sait hiljem maksab.
Tegevuskava, kui leht ei ole indeksis
- Kontrolli konkreetse URL-i staatust Search Console'i URL-i kontrolli tööriistas.
- Kui staatus räägib keelust, eemalda see: võta maha noindex, paranda robots.txt, korrasta canonical.
- Veendu, et URL vastab koodiga 200 ja et kogu põhisisu on renderdatud HTML-is näha.
- Lisa leht saidikaardile ja pane sellele 2–3 siselinki asjakohastelt lehtedelt.
- Kui keelde ei ole ja staatus on Avastatud, kuid pole indekseeritud, tee sisu ümber: lisa see, mida konkurentidel ei ole, ja viska mallilaadsed lõigud välja.
- Saada URL uuesti roomamisele: kas Search Console'i kontrolli tööriista kaudu või nimekirjana @BoostIndexBot'i kaudu. Üks kord, mitte iga päev.
- Oota kaks-kolm nädalat ja vaata staatust uuesti. Varem on järelduste tegemine mõttetu.
Kui leht on ka pärast seda indeksist väljas, ei ole probleem peaaegu kindlasti temas üksi, vaid selles, kuidas sait tervikuna üles on ehitatud — ja see on juba veebiarenduse tasandi ülesanne, mitte ühe URL-i parandus.
