Vai bloķēt AI robotus: ko izlēma mediji un kas der citiem uzņēmumiem
Katra piektā Latvijas mediju mājaslapa robots.txt failā bloķē AI crawler, citās nozarēs tādu ir maz. Izdevējiem tam ir iemesls, vairumam uzņēmumu nav.
Lielākā daļa Latvijas uzņēmumu savā robots.txt failā par AI crawler nav uzrakstījuši ne rindiņas. Viena nozare ir izņēmums, un tā ir tieši tā, kuras ieņēmumus AI atbildes apdraud visvairāk: mediji.
Izdevējiem ir labi iemesli bloķēt, un tos ir vērts saprast, pirms viņus atdarināt. Lielākajai daļai uzņēmumu tie paši iemesli liek rīkoties pretēji.
Īsumā
Mediji bloķē AI crawler, jo viņu teksts ir produkts: ja AI atbilde rakstu apkopo, lasītājs var neatvērt lapu, no kuras izdevējs pelna. Latvijā AI bloķēšanu robots.txt failā deklarē 21 % mediju un izdevējdarbības mājaslapu (278 no 1 325), Igaunijā 9 %, Lietuvā 11 %, un neviena cita nozare nevienā no trim valstīm nepārsniedz 12 %. Delfi un TVNET neielaiž OpenAI un Perplexity meklēšanas crawler, bet LSM, LA.lv un Jauns.lv AI crawler savos failos nemin vispār. Ja jūsu teksts vajadzīgs, lai atrastu klientus, meklēšanas crawler strādā jūsu labā, un, tos bloķējot, jūs pazūdat no AI atbildēm. Apmācības crawler ir atsevišķs lēmums, un to varat pieņemt jebkurā virzienā.
Mediji AI bloķē biežāk nekā jebkura cita nozare
Baltijas mājaslapu pētījumā 2026. gada jūlijā un augustā izmērījām 293 806 Latvijas, Igaunijas un Lietuvas mājaslapas, nolasījām katru robots.txt, ko varējām sasniegt, un mājaslapas sašķirojām pa nozarēm. Kad abus datus saliek kopā, visās trijās valstīs izceļas viena nozare:
| Valsts | Mediju un izdevēju mājaslapas, kas deklarē AI bloķēšanu | Nākamā nozare |
|---|---|---|
| Latvija | 21 % (278 no 1 325) | “cits” ar 12 %, finanses ar 10 % |
| Lietuva | 11 % (256 no 2 374) | finanses un “cits” ar 7 % |
| Igaunija | 9 % (117 no 1 337) | e-komercija ar 4 % |
Latvijas izdevēji AI bloķēšanu deklarē apmēram divreiz biežāk nekā Lietuvas un vairāk nekā divreiz biežāk nekā Igaunijas izdevēji. Profesionālo pakalpojumu uzņēmumiem Latvijā tādu ir 4 %.
Tā ir deklarēta politika, rindas, ko mājaslapa pati ieraksta savā failā. Tas ir cits slānis nekā rakstā par mājaslapām, kas bloķē AI asistentus, pašām to nezinot. Tur mērījām, ko serveri patiešām dara, un lielākoties bloķēja CDN vai drošības produkta noklusējums, ko neviens nebija izvēlējies. Šeit īpašnieki izvēlējās paši.
Ko raksta Latvijas ziņu portālu robots.txt
Pētījumā publicējam tikai kopsavilkumus un nevienu mājaslapu nenosaucam. Ziņu portālu robots.txt faili tomēr ir publiski, un tajos redzams, kā izskatās apzināts lēmums. Piecu portālu failus nolasījām 2026. gada 30. septembrī:
| Crawler | Ko tas dara | Delfi | TVNET | LSM, LA.lv, Jauns.lv |
|---|---|---|---|---|
GPTBot | OpenAI, apmācība | Aizliegts | Aizliegts | Nav minēts |
OAI-SearchBot | ChatGPT meklēšanas atbildes | Aizliegts | Aizliegts | Nav minēts |
ChatGPT-User | ChatGPT atver lapu lietotāja jautājumam | Aizliegts | Aizliegts | Nav minēts |
ClaudeBot | Anthropic, apmācība | Aizliegts | Aizliegts | Nav minēts |
Claude-SearchBot | Claude meklēšanas atbildes | Nav minēts | Nav minēts | Nav minēts |
PerplexityBot | Perplexity meklēšana | Aizliegts | Aizliegts | Nav minēts |
Google-Extended | Gemini apmācība | Aizliegts | Aizliegts | Nav minēts |
“Nav minēts” nozīmē, ka uz šo crawler attiecas faila vispārīgie noteikumi, un nevienā no pieciem failiem tie rakstus neslēdz. Tātad Delfi un TVNET pēc nosaukuma aizliedz gandrīz visus AI crawler, arī meklēšanas crawler, bet Anthropic meklēšanas crawler nav pieminējuši. TVNET aizliegums gan ir uzrakstīts nestandarta formā, par to zemāk. Sabiedriskais medijs LSM un abi pārējie portāli AI crawler ielaiž ar tiem pašiem noteikumiem kā jebkuru citu.
Viena detaļa TVNET failā noder ikvienam, kas savu robots.txt raksta ar roku. AI crawler grupa tur beidzas ar rindu Disallow: *. Standarts RFC 9309 paredz, ka noteikuma ceļš sākas ar slīpsvītru, tāpēc parastais pieraksts ir Disallow: /. Kā katrs crawler lasa rindu, kas neatbilst standarta pierakstam, izlemj pats crawler, nevis mājaslapa.
Fails ir cenrādis, nevis siena
Lielie starptautiskie izdevēji rāda, kāpēc bloķēšana ir arī sarunu pozīcija. Britu laikraksts Guardian savā robots.txt failā pēc nosaukuma aizliedz ClaudeBot un PerplexityBot, bet OpenAI crawler nemin. Tas nav nejauši: 2025. gada 14. februārī Guardian Media Group paziņoja par sadarbību ar OpenAI, un ka Guardian žurnālistika būs pieejama ChatGPT kā ziņu avots, ar atsaucēm, īsiem kopsavilkumiem un fragmentiem. Faila sākumā norādīta e-pasta adrese licencēšanai, pēdējā rindā saite uz licences failu.
Izdevēji saprot, ka robots.txt nav veids, kā pazust. Ar to izdevējs, kura tekstam ir cena, piekļuvi padara par sarunu jautājumu un vienojas ar katru AI uzņēmumu atsevišķi. Guardian failā neminēts palika tieši tas AI uzņēmums, ar kuru tas vienojās par noteikumiem.
Jāzina arī, ko fails nespēj. RFC 9309 par saviem noteikumiem raksta: “These rules are not a form of access authorization” (šie noteikumi nav piekļuves atļauja). Rinda robots.txt failā ir publisks lūgums, ko dokumentētie crawler sola ievērot. Izdevēja ietekme rodas no tā, ka lūgums ir publisks, nevis no tā, ka fails kaut ko apturētu.
Google AI atbildes ar robots.txt atsevišķi izslēgt nevar
Google dokumentācija par Google-Extended saka, ka šis iestatījums “does not impact a site’s inclusion in Google Search” (neietekmē mājaslapas iekļaušanu Google meklēšanā) un nav ranžēšanas signāls. Tātad Delfi un TVNET, bloķējot Google-Extended, no AI Overviews nepazūd.
Google lapā par AI funkcijām un jūsu mājaslapu paskaidrots, kāpēc: AI ir iebūvēts meklēšanā un ir tās neatņemama daļa, tāpēc piekļuvi pārvalda ar parastajiem Googlebot noteikumiem robots.txt failā. Ja gribat ierobežot, ko Google rāda, jālieto nosnippet, data-nosnippet, max-snippet vai noindex, un tie tādā pašā mērā ierobežo arī parastos meklēšanas rezultātus.
Google meklēšanā atsevišķa AI slēdža nav. Uzņēmums, kas bloķē Google-Extended, cerot neparādīties AI Overviews, meklēšanā neko nav mainījis.
Uzņēmuma mājaslapai atbilde ir cita
Ziņu portāla raksts ir tas, ko portāls pārdod. Ja AI atbilde rakstu labi apkopo, lasītājs var portālu neatvērt, un tieši apmeklējums nes abonementu vai reklāmas ieņēmumus. Bloķējot, izdevējs sargā produktu un stiprina savu pozīciju sarunās.
Pakalpojumu uzņēmuma lapa ir cita veida teksts. Tā vajadzīga, lai cilvēks, kuram vajag pakalpojumu, uzņēmumu atrastu un sazinātos. Ja AI atbilde šo lapu citē un nosauc uzņēmumu, lapa ir izdarījusi savu darbu, un, aizliedzot crawler, uzņēmums neko nepasargā. Ko atteikums maksā, ražotāji raksta paši, abus dokumentus pārbaudījām 2026. gada 30. septembrī:
- OpenAI crawler dokumentācijā rakstīts, ka mājaslapas, kas bloķē
OAI-SearchBot, ChatGPT meklēšanas atbildēs neparādīsies, ja nu vienīgi kā navigācijas saites. - Anthropic lapā par crawler rakstīts, ka
Claude-SearchBotatslēgšana neļauj indeksēt jūsu saturu meklēšanai un var samazināt jūsu mājaslapas redzamību lietotāju meklēšanas rezultātos.
Apmācība ir tā daļa, par kuru uzņēmums var lemt jebkurā virzienā, jo ražotāji to nodala. OpenAI to min kā piemēru: mājaslapa var ielaist OAI-SearchBot, lai parādītos meklēšanas rezultātos, un aizliegt GPTBot, lai saturu neizmantotu apmācībai. Vai ar jūsu lapām drīkst apmācīt kāda cita modeli, ir īsts jautājums par jūsu saturu, bet ar to, vai jūs citēs, tas nav saistīts.
No izdevējiem tātad ir vērts pārņemt nevis pašu bloķēšanu, bet to, ka viņi par katru crawler lēma atsevišķi, rakstiski un zinot, ko tas dara.
Vai bloķēt AI robotus, izlemj jūsu teksta mērķis
| Jūsu teksts ir | Apmācības crawler (GPTBot, ClaudeBot, Google-Extended) | Meklēšanas un lietotāju crawler (OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot) |
|---|---|---|
| Produkts: žurnālistika, maksas pētījumi, mācību materiāli | Aizliegt, ja vien nelicencējat | Aizliegt vai ielaist tos, ar kuriem esat vienojušies |
| Piedāvājums: pakalpojumi, B2B, veikals, vietējais uzņēmums | Jūsu izvēle, un no tās nav atkarīgs, vai jūs citēs | Ielaist |
| Palīdzība klientiem: dokumentācija, atbalsts, instrukcijas | Jūsu izvēle | Ielaist, jo tieši šeit klienti tagad jautā |
Ja esat pirmajā rindā, jūs esat izdevējs, un robots.txt ir daļa no jūsu biznesa stratēģijas. Gandrīz visi pārējie ir otrajā vai trešajā rindā.
Ko varat izdarīt paši un kad vajag izstrādātāju
To varat iestatīt paši. Atveriet https://jusudomens.lv/robots.txt, paskatieties, kurus no augstāk minētajiem crawler fails nosauc, un katram lēmumam uzrakstiet savu grupu. Ja gribat palikt AI atbildēs, bet neļaut saturu izmantot apmācībai, pietiek ar šīm rindām:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
Meklēšanas crawler nenosauciet, tad uz tiem attiecas vispārīgie noteikumi. Izmaiņu var atsaukt minūtes laikā.
Izstrādātāju vajag divos gadījumos. Pirmais: fails saka vienu, bet serveris dara citu, jo CDN, ugunsmūris vai drošības spraudnis neielaiž crawler, kurus fails atļauj. Kā to pārbaudīt, aprakstījām rakstā par nejaušu AI bloķēšanu, un tas notiek bieži. Otrais: gribat daļu lapas paslēpt no Google fragmentiem un AI funkcijām, bet ne visu lapu. Tad data-nosnippet jāieliek veidnēs, un ar vienu iestatījumu to izdarīt nevar.
Kāpēc mēs to varam apgalvot
Nozaru skaitļi nāk no Baltijas mājaslapu pētījuma: 2026. gada jūlijā un augustā izmērījām 293 806 no 306 872 Baltijas domēniem, nozari norādām tikai tad, ja klasifikatora ticamība bija vismaz 0,7, un publicējam tikai kopsavilkumus, nevienu mājaslapu nenosaucot. Metode un visa nozaru nodaļa ir pētījumā. Ziņu portālu faili ir to pašu publiskie robots.txt, nolasīti 2026. gada 30. septembrī.
Ja gribat zināt, kā jūsu fails un jūsu serveris izturas pret katru AI crawler un kurš AI meklētājs jūs patiešām citē, to mēra redzamība AI meklējumos.