Arutame projekti

Miks Google ei indekseeri lehti

Miks Google ei indekseeri lehti: mida Search Console'i staatused tähendavad, millised on tegelikud põhjused ja mis järjekorras neid parandada.

Vladislav Krivorutsko20. juuli 20268 min lugemist
Sisukord

TL;DR — lühidalt peamisest

  • Indekseerimine ei ole kellelegi garanteeritud: Google otsustab ise, kas leht väärib indeksis kohta, ja keeldub sagedamini madala väärtuse kui tehnilise vea tõttu
  • Alusta alati Search Console'i aruandest Lehtede indekseerimine — ravi sõltub täpsest staatusest, mitte üldisest tundest, et leht ei indekseeru
  • Staatus Avastatud, kuid pole indekseeritud tähendab peaaegu alati prioriteedi ja sisu väärtuse küsimust, mitte keeldu: URL on teada, aga roomajale pole seda väärt külastada
  • Tehnilised keelud — noindex, robots.txt, võõrale URL-ile viitav canonical, 4xx, ümbersuunamine — annavad eraldi üheselt mõistetavad staatused ja on parandatavad ühe õhtuga
  • Roomamist saab kiirendada: käsitsi saatmine Search Console'is ja bot @BoostIndexBot viivad kvaliteetsed lehed indeksisse ööpäeva jooksul, kuid kumbki ei tühista kvaliteedihinnangut

Lühike vastus

Lehed ei indekseeru Google'is ühel kahest põhjuste rühmast: kas oled indekseerimise ise tehniliselt keelanud (see on üks osa sellest, mida katab veebilehe tehniline optimeerimine) või on Google otsustanud, et leht ei ole piisavalt väärtuslik, et talle indeksis kohta anda. Esimene rühm saab korda ühe õhtuga, teine võtab nädalaid tööd sisu ja struktuuriga.

Oluline täpsustus, mis maandab poole ärevusest: indekseerimine ei ole garanteeritud. Google ütleb otse, et ei luba indekseerida kõiki saidi lehti — see on normaalne tööseisund, mitte rike. Täpse põhjuse iga URL-i kohta näitab Search Console'i aruanne Lehtede indekseerimine ja alustada tulebki ainult sealt.


Kuidas leida tegelik põhjus, mitte oletada

Järjekord on täpselt selline:

  1. Ava Search Console → Indekseerimine → Lehed. All on põhjuste loend koos URL-ide arvuga iga rea kohta.
  2. Leia oma lehed sellest loendist ja vaata staatuse sõnastust. See ongi diagnoos.
  3. Konkreetse URL-i jaoks kasuta ülal olevat URL-i kontrolli tööriista: see näitab, kas aadress on Google'ile teada, millal seda roomati, millise canonical'i Google valis ja mida roomaja näeb.
  4. Vajuta URL-i kontrollis nuppu, mis testib lehte otse saidil — see näitab renderdatud HTML-i. Kasulik siis, kui sisu laaditakse skriptidega ja roomaja näeb tühja lehte.

Üks nõuanne praktikast: ära vaata indekseeritud lehtede koguarvu. See erineb peaaegu alati sinu ettekujutusest saidi suurusest, sest sinna satuvad ka tehnilised URL-id, ja eraldi võetuna ei tähenda see midagi. Vaata põhjuste kaupa.

Mida Search Console'i staatused tähendavad

StaatusMis juhtusKas see on probleem?
Avastatud, kuid pole indekseeritudURL on teada, aga pole roomatudJah, prioriteedi ja väärtuse küsimus
Roomatud, kuid pole indekseeritudLeht loeti läbi ja jäeti indeksist väljaJah, sisu kvaliteedi küsimus
Ümbersuunamisega lehtURL vastab 301 või 302Ei, kui ümbersuunamine on tahtlik
Blokeeritud robots.txt-failigaRoomamine on keelatudJah, kui keeld on juhuslik
Leht sisaldab noindex-siltiOtsene indekseerimiskeeldJah, kui silt pole sinu pandud
Alternatiivne leht korrektse canonical'igaGoogle valis peamiseks teise URL-iEi, kui canonical on õige
Duplikaat: Google valis teise canonical'iSinu canonical jäeti arvestamataJah, nõrga unikaalsuse märk
Ei leitud (404)Lehte pole olemasEi, kui kustutasid selle meelega
Serveri viga (5xx)Server ei tagastanud lehteJah, paranda esimesena

Eraldi kahest kõige sagedasemast reast. Avastatud, kuid pole indekseeritud ja Roomatud, kuid pole indekseeritud hirmutavad kõige rohkem, kuid just need tähendavad, et tehnilist keeldu ei ole. Google näeb URL-i ja otsustab sellele ressurssi mitte kulutada. See ei ole rike, mida otsida, vaid hinnang, mida muuta.

Tehnilised põhjused: paranevad ühe õhtuga

Loend on lühike, aga see tuleb üle käia enne kõike muud — sest kuni keeld kehtib, ei aita mingi sisutöö.

  1. Noindex-metasilt. Kõige sagedasem lugu: sait ehiti arenduskeskkonnas indekseerimine kinni, viidi live'i ja unustati linnuke ära võtta. WordPressis on see lugemise seadetes valik, mis palub otsimootoritel saiti mitte indekseerida. Kontrolli, otsides lehe lähtekoodist sõna noindex.
  2. Keeld robots.txt-is. Ava sinu-sait.ee/robots.txt ja veendu, et seal ei ole Disallow: /. Ja pea meeles lõksu: robots.txt-iga suletud lehte ei roomata, seega ei näe Google seal olevat noindex-silti, kui sa selle sinna panid.
  3. Canonical teisele URL-ile. Kui lehel on rel="canonical" teise lehe aadressiga, oled ise Google'ile öelnud, et see leht on teisejärguline. Suurtel saitidel on see sageli malli vale seadistuse tagajärg, kus terve rubriik kanoniseeritakse kategooriale. Mitmekeelsetel saitidel kanoniseerib sama mall mittepõhilised keeleversioonid põhiversioonile — selle stsenaariumi võtsin lahti artiklis hreflangi seadistamisest ja levinud vigadest.
  4. HTTP-staatus. Leht peab vastama koodiga 200. Kontrolli, et ei oleks ümbersuunamiste ahelat, elava sisu juures 404-t ega koormuse all tekkivaid 5xx-vigu.
  5. Puudumine saidikaardilt ja siselinkidest. Leht, millele ei vii ühtegi linki saidilt ja mida pole sitemap'is, on roomaja jaoks peaaegu olematu.
  6. Sisu ainult JavaScriptis. Google oskab JS-i renderdada, kuid teeb seda teises järjekorras ja mitte alati lõpuni. Kui renderdatud HTML-is on teksti asemel tühjus, indekseerub leht halvasti.

Eraldi rida on serveri stabiilsus. Google ütleb, et aeglaste vastuste ja vigade korral vähendab ta roomamise sagedust. Sellest kirjutasin ka analüüsis, kas saidi kiirus mõjutab positsioone: väikesele saidile see suurt ei loe, kümnete tuhandete URL-idega poele on kriitiline. Kolimist ise aga karta ei tasu: majutuse vahetus ei halvenda SEO-d, kui migratsioon on tehtud korrektselt ja ümbersuunamised on paigas.

Kvaliteedipõhised põhjused: paranevad nädalatega

Kui tehnilisi keelde ei ole ja lehed seisavad staatuses Avastatud, kuid pole indekseeritud, käib jutt väärtusest. Mis päriselt töötab:

  • Unikaalne mõte, mitte unikaalne tekst. Leht, mis jutustab ümber seda, mis on indeksis juba kahekümnes variandis, ei anna Google'ile põhjust lisada kahekümne esimest. Vaja on oma nurka: oma andmeid, oma kogemust, oma vastuse ülesehitust.
  • Siselingid. Sissetulevate linkideta leht näeb välja nagu mustand. Anna sellele link asjakohasest rubriigist või artiklist — sageli piisab ainuüksi sellest, et URL liiguks avastatud seisundist indeksisse.
  • Vähem lehti, aga tihedamalt. Kümme tühja lehte lähisünonüümide alla töötavad halvemini kui üks põhjalik. See maandab ka kannibaliseerimise riski, mille vastu aitab korralik SEO-optimeerimine, kui kaks lehte võistlevad sama päringu pärast ja mõlemad kaotavad.
  • Genereeritud URL-ide kontroll. Filtrid, sorteerimised, lehekülgede jaotus ja parameetrid loovad tuhandeid aadresse, mis söövad roomamise limiiti. Need tuleb sulgeda noindex-siltiga või kanoniseerida — siis jõuab roomaja vajalike lehtedeni kiiremini.
  • Saidi üldine värskus. Regulaarselt uuenevatel saitidel indekseeruvad uued lehed märgatavalt kiiremini kui seisma jäänutel. Sama tähelepanek on hästi näha mitmekeelsetes projektides — kirjutasin sellest artiklis, mis keeles veebilehte Eestis turundada.

Kuidas uue lehe indekseerimist kiirendada

Lehe avastamist saab tõesti kiirendada, kuid piir tuleb selgelt paika panna: iga kiirendusvahend mõjutab seda, kui ruttu Googlebot lehele jõuab, mitte otsust seda indeksisse võtta. Nõrga lehe puhul jõuad kiirendusega lihtsalt kiiremini keeldumiseni.

URL-i käsitsi saatmine Search Console'is. Kõige lihtsam ja tasuta viis. Ava URL-i kontrolli tööriist, kleebi aadress ja vajuta indekseerimise taotlemise nuppu — Google paneb URL-i eelisjärjekorda ja uus roomamine toimub tavaliselt tundide või päevadega, mitte nädalatega. See on standardsamm iga uue lehe avaldamise ja iga olulise muudatuse järel. Piirangud: päevane kvoot taotluste arvule ja sama URL-i korduv saatmine midagi juurde ei anna — järjekord on üks.

Telegrami bot @BoostIndexBot. Töötab Google'i indekseerimise API kaudu: annad botile URL-ide nimekirja, tema saadab need otse roomamisjärjekorda ja näitab iga lingi staatust. Minu kogemuse põhjal jõuavad kvaliteetsed uued lehed pärast sellist saatmist indeksisse ööpäeva jooksul — märgatavalt kiiremini kui tavalist roomamist oodates. Märksõna on siin kvaliteetsed: lehti, mida Google niikuinii võtta ei kavatsenud, bot indeksisse ei suru. Ta kiirendab roomamist, ei tühista hinnangut.

Praktikas on kõige mugavam kombinatsioon: uute URL-ide masssaatmine käib läbi @BoostIndexBot ja Search Console jääb konkreetsete aadresside punktkontrolliks ja diagnostikaks — sealt on ka näha, mille Google lõpuks otsustas.

Mida kiirendamine ei tee: ei tõsta positsioone, ei asenda siselinke ega päästa õhukesi lehti. Kui leht jõudis indeksisse ööpäevaga ja kuu aja pärast kukkus sealt välja, oli probleem sisus, mitte roomamise kiiruses.

Mida ma oma projektides näen

Põhiline osa mu sissetulekust tuleb enda saitidelt konkurentsitihedates nišides ja indekseerimise pilt on seal üsna ühetaoline: elavatel, regulaarselt uuenevatel projektidel jõuavad uued materjalid indeksisse ise ja kiiresti, hüljatud saitidel võivad täpselt samad tekstid seista avastatud staatuses kuid. Vahe ei ole tekstides, vaid selles, kas roomaja üldse saidil käib.

Teine tähelepanek on massilehtede kohta. Iga kord, kui olen genereerinud suure hulga ühetaolisi lehti madalsageduslike päringute alla, on osa neist Google'il lihtsalt vastu võtmata jäänud. Ei karistanud, ei eemaldanud indeksist olemasolevat — ignoreeris vaikselt uusi. Sellest tegin praktilise järelduse: lehtede arvu tasub kasvatada aeglasemalt, kui tehnika lubaks.

Ausad piirid. Kõik eelnev käib teenusesaitide, väikepoodide ja sisuprojektide kohta — see tähendab tüüpilise Eesti väikeettevõtte ja minu enda projektide kohta. Sadade tuhandete URL-idega saitidel tõuseb esiplaanile roomamise eelarve loogika ja seal on prioriteedid teised: serverilogid, roomamise limiidid, fassettnavigatsiooni käsitlemine. Sellises mahus omi andmeid mul ei ole, seega ma neist ka ei kirjuta.

Ja ausalt tähtaegadest. Roomamist saab kiirendada ja ülalkirjeldatud vahendid seda teevadki. Mida teha ei saa, on sundida Google'it indeksisse võtma lehte, mida ta võtta ei taha. Vahe on põhimõtteline: URL-i saatmine lühendab ootuse nädalatelt ööpäevale lehe puhul, mis oleks valiku niikuinii läbinud, kuid ei muuda otsust nõrga lehe kohta. Seega kui sulle lubatakse raha eest ükskõik milliste lehtede garanteeritud indekseerimist, on jutt kas sellest, mis oleks niikuinii juhtunud, või skeemidest, mille eest sait hiljem maksab.

Tegevuskava, kui leht ei ole indeksis

  1. Kontrolli konkreetse URL-i staatust Search Console'i URL-i kontrolli tööriistas.
  2. Kui staatus räägib keelust, eemalda see: võta maha noindex, paranda robots.txt, korrasta canonical.
  3. Veendu, et URL vastab koodiga 200 ja et kogu põhisisu on renderdatud HTML-is näha.
  4. Lisa leht saidikaardile ja pane sellele 2–3 siselinki asjakohastelt lehtedelt.
  5. Kui keelde ei ole ja staatus on Avastatud, kuid pole indekseeritud, tee sisu ümber: lisa see, mida konkurentidel ei ole, ja viska mallilaadsed lõigud välja.
  6. Saada URL uuesti roomamisele: kas Search Console'i kontrolli tööriista kaudu või nimekirjana @BoostIndexBot'i kaudu. Üks kord, mitte iga päev.
  7. Oota kaks-kolm nädalat ja vaata staatust uuesti. Varem on järelduste tegemine mõttetu.

Kui leht on ka pärast seda indeksist väljas, ei ole probleem peaaegu kindlasti temas üksi, vaid selles, kuidas sait tervikuna üles on ehitatud — ja see on juba veebiarenduse tasandi ülesanne, mitte ühe URL-i parandus.

Korduma kippuvad küsimused

Kui kaua Google uut lehte indekseerib?
Elaval, regulaarselt uuenevas saidil jõuab uus leht indeksisse tavaliselt mõne tunni kuni mõne päevaga. Uuel domeenil ilma ajaloo ja välislinkideta on normaalne ootus üks kuni mitu nädalat ja see ei ole viga. Google ei anna tähtaegade osas mingeid lubadusi ja ütleb otse, et ühegi lehe indekseerimine ei ole garanteeritud.
Mida tähendab staatus Avastatud, kuid pole indekseeritud?
Google teab URL-i — leidis selle saidikaardist või lingilt —, kuid ei ole seda roomanud. See on prioriteedi küsimus: roomaja otsustas, et leht ei vääri praegu serveripäringut. Tüüpilised põhjused on õhuke või mallilaadne sisu, siselinkide puudumine, tohutu hulk sarnaseid URL-e ja aeglane server. Tehnilist keeldu siin ei ole, seega pole midagi eemaldada: tuleb tõsta lehe väärtust ja seotust ülejäänud saidiga.
Mille poolest erineb Roomatud, kuid pole indekseeritud eelmisest staatusest?
Esimesel juhul laadis Googlebot lehe alla ja luges läbi, kuid otsustas seda indeksisse mitte lisada. Teisel juhul ei laadinud üldse. Roomatud, kuid pole indekseeritud on otsesem kvaliteedipõhine keeldumine: sisu nähti ja peeti ebapiisavalt väärtuslikuks või juba indeksis olevat dubleerivaks. Ravitakse sisu ümbertegemisega, mitte tehniliste parandustega.
Kas URL-i käsitsi indekseerimisele saatmine aitab?
Jah, roomamise kiiruse mõttes. Indekseerimise taotlemise nupp URL-i kontrolli tööriistas paneb aadressi eelisjärjekorda ja uus roomamine toimub tavaliselt tundide või päevadega, mitte nädalatega. Sundida Google'it lehte indekseerima see aga ei suuda: kui keeldumise põhjus oli kvaliteedis, ei muuda korduv saatmine midagi ja leht satub samasse staatusesse tagasi. Taotluste arvul on päevane kvoot.
Kuidas saada uued lehed kiiresti Google'i indeksisse?
Kaks töötavat viisi. Esimene on URL-i käsitsi saatmine Search Console'i URL-i kontrolli tööriista kaudu — tasuta, kuid ühekaupa ja päevase kvoodiga. Teine on Telegrami bot @BoostIndexBot, mis saadab URL-ide nimekirju Google'i indekseerimise API kaudu ja näitab iga lingi staatust; kvaliteetsed lehed jõuavad pärast sellist saatmist tavaliselt indeksisse ööpäeva jooksul. Mõlemad kiirendavad roomamist, kuid ei tühista kvaliteedihinnangut: nõrka lehte ei suru indeksisse kumbki.
Kas tehnilised lehed tuleks indekseerimisest välja jätta?
Jah, aga sihipäraselt ja teadlikult. Filtrid, sorteerimised, saidisisese otsingu tulemused, ostukorv ja kasutajakonto ei peaks tavaliselt indeksisse sattuma — sulge need noindex-metasildiga. Oluline nüanss: kui leht on robots.txt-is kinni, ei saa Google seda roomata ega näe seal olevat noindex-silti, seega neid kahte tööriista ei tohi samale URL-ile korraga rakendada.

Järeldused

Alusta mitte foorumist ega indekseerimist kiirendavast teenusest, vaid Search Console'i aruandest Lehtede indekseerimine: see ütleb täpse põhjuse ja edasi jääb valida stsenaarium. Tehnilised keelud kaovad kiiresti, aga staatus Avastatud, kuid pole indekseeritud on jutt lehe väärtusest, siselinkidest ja saidi struktuurist ning võtab nädalaid. Kui lehti on palju ja pilt on segane, on indekseerimise lahtiharutamine tavaline osa minu SEO-optimeerimise tööst.

Artikli autor

Vladislav Krivorutsko — ADLABi asutaja
Vladislav Krivorutsko

ADLAB OÜ asutaja · SEO ja Google Ads

Üle 20 aasta otsiliikluse ja monetiseerimisega, Eesti turul alates 2017. aastast. Töötan üksi: teen auditi, koostan strateegia ja viin projekti ise lõpuni — ilma alltöövõtjate ja šabloonideta. Kirjutan ainult sellest, mida olen oma ja klientide saitidel järele proovinud.

  • 20+ aastat otsiliikluses
  • 50+ projekti võtmed kätte
  • Oma saidid konkurentsitihedates nišides
  • SEO ru/et/en ühes otsingutulemuses
Loe minust lähemalt

Loe edasi