SEO Sprendimai | Sitemap ir robots.txt: kam jie reikalingi ir kaip juos susitvarkyti

Turinys

Sitemap ir robots.txt: kam jie reikalingi ir kaip juos susitvarkyti

Google Search Console pranešimas: “Sitemap could not be read.” Savininkas tikrina – sitemap URL grąžina 404 klaidą, nes plugin’as buvo išjungtas prieš tris mėnesius ir niekas nepastebėjo. Tuo pat metu robots.txt faile yra Disallow: / eilutė – visiškas šliaužimo blokavimas, paliktas iš testavimo aplinkos. Svetainė technikoje veikia. Google jos nemato.

Abi klaidos – sitemap ir robots.txt – yra techninio SEO pagrindai, kurie daugelį metų gali veikti tyliai ir teisingai, o tada vienas netikėtas pakeitimas juos sulaužo ir niekas nepastebi, kol organinis srautas pradeda smukti.

Perskaitę žinosite, kaip XML sitemap ir robots.txt failas veikia, kur dažniausiai kyla problemų ir kaip patikrinti, ar jūsų konfigūracija šiuo metu neblokuoja Google ten, kur turėtų leisti.

Kas yra XML sitemap ir kodėl jis pagreitina indeksavimą

XML sitemap – tai failas, kuriame surašyti visi svarbūs jūsų svetainės URL. Jis pateikiamas Googlebot kaip navigacinis žemėlapis: vietoje to, kad robotas ieškotų jūsų puslapių sekdamas nuorodų grandinę per visą svetainę, sitemap tiesiogiai pasako, kokie URL egzistuoja ir kada jie paskutinį kartą keisti.

Tai nereiškia, kad Googlebot nušliaužia nuorodų – jis daro abu. Sitemap veikia kaip papildomas signalas, ypač naujai sukurtiems puslapiams, kurie dar neturi vidinių nuorodų iš kitų svetainės dalių, arba didelėms svetainėms, kur kiekvienas puslapis gali ir neturėti nuorodos iš pagrindinio turinio.

Sitemap efektyvumas labiausiai matomas dviem scenarijuose: nauja svetainė be išorinių atgalinių nuorodų (kur Googlebot kitaip tiesiog nerastų daugelio puslapių) ir didelė e-komercijos parduotuvė su tūkstančiais produktų, kur crawl budget yra ribotas ir sitemap padeda nukreipti šliaužimą į prioritetinius puslapius.

Kaip sitemap struktūra veikia: lastmod, priority ir changefreq

XML sitemap turi keturis pagrindinius elementus – ir ne visi jie vienodai svarbūs.

<loc> – URL adresas. Privalomas. Jis turi tiksliai atitikti kanonizuotą puslapio URL, įskaitant HTTPS ir www / non-www nuoseklumą.

<lastmod> – paskutinio keitimo data ISO 8601 formatu. Tai vienintelė žyma, kurią Google aktyviai naudoja šliaužimo prioriteto sprendimams. Jei lastmod data nauja – Googlebot greičiau apsilanko. Jei ji kinta nereguliарiai be realių turinio pakeitimų – Google pradeda ją ignoruoti kaip nepatikimą signalą. Dinaminis sitemap, automatiškai atnaujinantis lastmod datą kiekvieną kartą publikuojant naują turinį, yra geriau nei statinis failas su rankiniu data valdymu.

<priority> ir <changefreq> – Google juos oficialiai naudoja minimaliai. John Mueller tai patvirtino 2022 m.: priority vertės tarp 0.1 ir 1.0 tiesiogiai nereitinguoja puslapių Google indekse. Jos gali suteikti šiek tiek orientacijos crawl budget paskirstymui, bet nekeičia organinių pozicijų. Daugelis WordPress sitemap generatorių juos vis dar rodo – tai konfigūracinis paliktinis, o ne aktyvus optimizavimo svirtas.

Sitemap limitas ir indeksas: ką daryti, kai puslapių šimtai

Vienas XML sitemap failas gali apimti maksimaliai 50 000 URL ir negali viršyti 50 MB dydžio. Svetainėms, kurios viršija šią ribą – didelės e-komercijos parduotuvės, daugiakalbiai portalai – reikalingas sitemap indeksas.

Sitemap indeksas – tai atskiras XML failas, nurodantis kelis individualius sitemap failus. Vietoje vieno milžiniško failo: sitemap_index.xmlsitemap_products.xml, sitemap_blog.xml, sitemap_categories.xml. Google seka indeksą ir nuskaito kiekvieną komponentą atskirai.

WordPress su Yoast SEO ar RankMath plugin’u generuoja sitemap indeksą automatiškai – atskirai puslapiams, įrašams, kategorijoms, žymoms. Tai tinka daugeliu atvejų, bet didelei e-komercijos parduotuvei su 30 000+ produktų verta patikrinti, ar sitemap tikrai apima visus produktus ir ar nėra URL tipų, kurie neturėtų būti įtraukti (filtravimo URL, paginacijos puslapiai su ?page=2 ir pan.).

robots.txt

Kas yra robots.txt ir kaip jis kontroliuoja šliaužimą

Robots.txt – tai tekstinis failas, esantis svetainės šakninėje direktorijoje (jusudomenas.lt/robots.txt), kuriame nurodoma, kurioms sritims robotai gali arba negali šliaužti.

Failas veikia per direktyvų sistemą. User-agent: * reiškia, kad taisyklė taikoma visiems robotams. User-agent: Googlebot – tik Google robotui. Disallow: /admin/ blokuoja šliaužimą administratoriaus skiltyje. Allow: /admin/login po Disallow leidžia išimtį – konkretų URL.

Čia slypi dažniausiai nesuprantamas dalykas: robots.txt blokuoja šliaužimą, bet ne indeksavimą. Tai esminis skirtumas. Puslapis, užblokuotas robots.txt, vis tiek gali atsirasti Google indekse – jei į jį nukreipia išorinės nuorodos. Google pamatys, kad puslapis egzistuoja, bet negalės nuskaityti jo turinio. Rezultatas: indeksuotas puslapis be aprašymo ir metaduomenų. Jei norite, kad puslapis nebūtų indeksuotas – reikalinga noindex meta žyma HTML, ne robots.txt blokavimas.

Kritinė klaida: robots.txt blokuoja visą svetainę

Tai ne teorinė grėsmė. Ji pasitaiko realiai ir kainuoja organinio srauto mėnesius.

Testavimo aplinkose WordPress automatiškai įjungia Discourage search engines from indexing this site nustatymą – tai prideda Disallow: / į robots.txt, blokuodamas visą šliaužimą. Kai svetainė perkelta į produkciją, šis nustatymas neretai paliekamas, nes jis nematomas per paprastą svetainės peržiūrą – tik atidaręs jusudomenas.lt/robots.txt arba Google Search Console robotų tikrinimo įrankį, galite jį pamatyti.

Screaming Frog nuskaitymo metu šliaužimo blokavimas matomas iš karto: visi URL grąžina “Blocked by robots.txt” statusą. Google Search Console robots.txt testeris leidžia tikrinti bet kurį URL prieš pat Googlebot veiksmą – tai greičiausias būdas patikrinti konfigūraciją be jokio nuskaitymo.

Ką įtraukti ir ko neįtraukti į sitemap

Ne kiekvienas svetainės URL turėtų būti sitemap – tai klaida, kuri švaisto crawl budget ir siunčia Google netvarkingus signalus.

Į sitemap turi patekti: pagrindiniai turinio puslapiai, straipsniai, produktai, kategorijos, paslaugų puslapiai. Tie, kuriuos norite, kad Google indeksuotų ir reitinguotų.

Neturi patekti: puslapiai su noindex žyma (tai prieštaravimas – kodėl prašyti indeksuoti tai, ką draudžiate?), paginacijos puslapiai (/page/2, /page/3), filtravimo URL su URL parametrais (pvz., /produktai?spalva=raudona&dydis=M), administratoriaus sritys, testavimo puslapiai, URL su sesijos identifikatoriais.

E-komercijos parduotuvėse filtravimo URL problema yra ypač dažna ir reikalauja specifinio sprendimo – arba canonical žymos nukreipimo į pagrindinę kategoriją, arba robots.txt Disallow atitinkamoms URL struktūroms, arba abiejų kartu.

Kaip pateikti sitemap Google ir ar tai būtina

Google sitemap randa keliais būdais – per robots.txt faile nurodytą nuorodą arba per tiesioginį pateikimą Search Console.

Robots.txt sitemap eilutė atrodo taip: Sitemap: https://jusudomenas.lt/sitemap.xml. Ši eilutė ne tik Google, bet ir Bing bei kitus robotus informuoja apie žemėlapio buvimą – viena eilutė, kelių robotų naudai.

Google Search Console sitemap pateikimas – tai papildoma galimybė, kuri suteikia tiesioginę diagnostiką: ar sitemap URL pasiekiamas, kiek URL jame rasta, kiek iš jų indeksuota. Jei rasta 450, o indeksuota 120 – tai signalas, kad 330 URL turi indeksavimo problemų, ir Search Console parodo, kodėl.

Ar sitemap pateikimas būtinas? Ne – Google jį ras ir be pateikimo, jei robots.txt nurodo nuorodą. Bet pateikimas per Search Console duoda matomeą diagnostiką, kurios neturėsite kitaip.

Kur sitemap ir robots.txt neišsprendžia problemų

Atvirai: sitemap nepriverstinai indeksuoja puslapių, kurių Google nenori. Jei puslapis thin content tipo, turi duplikuotą turinį ar neturi atgalinių nuorodų bei vidinių nuorodų – sitemap įtraukimas jo neišsaugo nuo deindeksavimo.

Robots.txt blokavimas neapsaugo nuo konfidencialios informacijos viešo matymo. Robots.txt yra vieša instrukcija – kiekvienas gali jį atidaryti ir pamatyti, kurias direktorijas bandote slėpti. Administratoriaus puslapiai, slapti dokumentai, vidiniai įrankiai – jų apsaugai reikalinga serverio lygio autentifikacija, ne robots.txt.

Ir dar: robots.txt Disallow taisyklės veikia tik geranoriškiems robotams. Piktybiniai šliaužytojai jas ignoruoja. Tai ne saugos sprendimas – tai SEO konfigūravimo priemonė.

Kaip patikrinti, ar jūsų konfigūracija teisin: du greiti žingsniai

Jei niekada netikrinote – atidarykite naršyklę ir įveskite jusudomenas.lt/robots.txt. Patikrinkite tris dalykus: ar nėra Disallow: / be jokios Allow išimties, ar Sitemap eilutė nurodo egzistuojantį URL, ar nėra netyčia blokuojamų aktyvių kategorijų.

Tada atidarykite jusudomenas.lt/sitemap.xml. Jei atsakymas 404 – sitemap neegzistuoja arba jo URL kitoks (WordPress Yoast SEO naudoja sitemap_index.xml). Jei atsakymas yra XML dokumentas – patikrinkite, ar jame matote pagrindiniai puslapiai ir ar paskutinių straipsnių URL atitinka tikruosius adresus.

Per artimiausias 30 dienų prisijunkite prie Google Search Console ir atidarykite “Sitemap” skyrių. Pažiūrėkite į vieną skaičių: kiek URL sitemap rasta ir kiek iš jų Google jau indeksavo. Jei skirtumas didesnis nei 30% – tai indeksavimo problemų signalas, kuris reikalauja tolesnės diagnostikos, ir Search Console rodys, kodėl tie puslapiai atmetami.

 

SEO Sprendimai atlieka techninį SEO auditą, apimantį sitemap ir robots.txt konfigūracijos tikrinimą, indeksavimo problemų diagnostiką ir Google Search Console duomenų interpretavimą Lietuvos verslo svetainėms. Susisiekite, jei norite įsitikinti, ar jūsų svetainė šiuo metu leidžia Google matyti viską, ką turėtų.