← Visi raksti
2026. gada 30. septembris

Vai bloķēt AI robotus: ko izlēma mediji un kas der citiem uzņēmumiem

Katra piektā Latvijas mediju mājaslapa robots.txt failā bloķē AI crawler, citās nozarēs tādu ir maz. Izdevējiem tam ir iemesls, vairumam uzņēmumu nav.

Lielākā daļa Latvijas uzņēmumu savā robots.txt failā par AI crawler nav uzrakstījuši ne rindiņas. Viena nozare ir izņēmums, un tā ir tieši tā, kuras ieņēmumus AI atbildes apdraud visvairāk: mediji.

Izdevējiem ir labi iemesli bloķēt, un tos ir vērts saprast, pirms viņus atdarināt. Lielākajai daļai uzņēmumu tie paši iemesli liek rīkoties pretēji.

Īsumā

Mediji bloķē AI crawler, jo viņu teksts ir produkts: ja AI atbilde rakstu apkopo, lasītājs var neatvērt lapu, no kuras izdevējs pelna. Latvijā AI bloķēšanu robots.txt failā deklarē 21 % mediju un izdevējdarbības mājaslapu (278 no 1 325), Igaunijā 9 %, Lietuvā 11 %, un neviena cita nozare nevienā no trim valstīm nepārsniedz 12 %. Delfi un TVNET neielaiž OpenAI un Perplexity meklēšanas crawler, bet LSM, LA.lv un Jauns.lv AI crawler savos failos nemin vispār. Ja jūsu teksts vajadzīgs, lai atrastu klientus, meklēšanas crawler strādā jūsu labā, un, tos bloķējot, jūs pazūdat no AI atbildēm. Apmācības crawler ir atsevišķs lēmums, un to varat pieņemt jebkurā virzienā.

Mediji AI bloķē biežāk nekā jebkura cita nozare

Baltijas mājaslapu pētījumā 2026. gada jūlijā un augustā izmērījām 293 806 Latvijas, Igaunijas un Lietuvas mājaslapas, nolasījām katru robots.txt, ko varējām sasniegt, un mājaslapas sašķirojām pa nozarēm. Kad abus datus saliek kopā, visās trijās valstīs izceļas viena nozare:

ValstsMediju un izdevēju mājaslapas, kas deklarē AI bloķēšanuNākamā nozare
Latvija21 % (278 no 1 325)“cits” ar 12 %, finanses ar 10 %
Lietuva11 % (256 no 2 374)finanses un “cits” ar 7 %
Igaunija9 % (117 no 1 337)e-komercija ar 4 %

Latvijas izdevēji AI bloķēšanu deklarē apmēram divreiz biežāk nekā Lietuvas un vairāk nekā divreiz biežāk nekā Igaunijas izdevēji. Profesionālo pakalpojumu uzņēmumiem Latvijā tādu ir 4 %.

Tā ir deklarēta politika, rindas, ko mājaslapa pati ieraksta savā failā. Tas ir cits slānis nekā rakstā par mājaslapām, kas bloķē AI asistentus, pašām to nezinot. Tur mērījām, ko serveri patiešām dara, un lielākoties bloķēja CDN vai drošības produkta noklusējums, ko neviens nebija izvēlējies. Šeit īpašnieki izvēlējās paši.

Ko raksta Latvijas ziņu portālu robots.txt

Pētījumā publicējam tikai kopsavilkumus un nevienu mājaslapu nenosaucam. Ziņu portālu robots.txt faili tomēr ir publiski, un tajos redzams, kā izskatās apzināts lēmums. Piecu portālu failus nolasījām 2026. gada 30. septembrī:

CrawlerKo tas daraDelfiTVNETLSM, LA.lv, Jauns.lv
GPTBotOpenAI, apmācībaAizliegtsAizliegtsNav minēts
OAI-SearchBotChatGPT meklēšanas atbildesAizliegtsAizliegtsNav minēts
ChatGPT-UserChatGPT atver lapu lietotāja jautājumamAizliegtsAizliegtsNav minēts
ClaudeBotAnthropic, apmācībaAizliegtsAizliegtsNav minēts
Claude-SearchBotClaude meklēšanas atbildesNav minētsNav minētsNav minēts
PerplexityBotPerplexity meklēšanaAizliegtsAizliegtsNav minēts
Google-ExtendedGemini apmācībaAizliegtsAizliegtsNav minēts

“Nav minēts” nozīmē, ka uz šo crawler attiecas faila vispārīgie noteikumi, un nevienā no pieciem failiem tie rakstus neslēdz. Tātad Delfi un TVNET pēc nosaukuma aizliedz gandrīz visus AI crawler, arī meklēšanas crawler, bet Anthropic meklēšanas crawler nav pieminējuši. TVNET aizliegums gan ir uzrakstīts nestandarta formā, par to zemāk. Sabiedriskais medijs LSM un abi pārējie portāli AI crawler ielaiž ar tiem pašiem noteikumiem kā jebkuru citu.

Viena detaļa TVNET failā noder ikvienam, kas savu robots.txt raksta ar roku. AI crawler grupa tur beidzas ar rindu Disallow: *. Standarts RFC 9309 paredz, ka noteikuma ceļš sākas ar slīpsvītru, tāpēc parastais pieraksts ir Disallow: /. Kā katrs crawler lasa rindu, kas neatbilst standarta pierakstam, izlemj pats crawler, nevis mājaslapa.

Fails ir cenrādis, nevis siena

Lielie starptautiskie izdevēji rāda, kāpēc bloķēšana ir arī sarunu pozīcija. Britu laikraksts Guardian savā robots.txt failā pēc nosaukuma aizliedz ClaudeBot un PerplexityBot, bet OpenAI crawler nemin. Tas nav nejauši: 2025. gada 14. februārī Guardian Media Group paziņoja par sadarbību ar OpenAI, un ka Guardian žurnālistika būs pieejama ChatGPT kā ziņu avots, ar atsaucēm, īsiem kopsavilkumiem un fragmentiem. Faila sākumā norādīta e-pasta adrese licencēšanai, pēdējā rindā saite uz licences failu.

Izdevēji saprot, ka robots.txt nav veids, kā pazust. Ar to izdevējs, kura tekstam ir cena, piekļuvi padara par sarunu jautājumu un vienojas ar katru AI uzņēmumu atsevišķi. Guardian failā neminēts palika tieši tas AI uzņēmums, ar kuru tas vienojās par noteikumiem.

Jāzina arī, ko fails nespēj. RFC 9309 par saviem noteikumiem raksta: “These rules are not a form of access authorization” (šie noteikumi nav piekļuves atļauja). Rinda robots.txt failā ir publisks lūgums, ko dokumentētie crawler sola ievērot. Izdevēja ietekme rodas no tā, ka lūgums ir publisks, nevis no tā, ka fails kaut ko apturētu.

Google AI atbildes ar robots.txt atsevišķi izslēgt nevar

Google dokumentācija par Google-Extended saka, ka šis iestatījums “does not impact a site’s inclusion in Google Search” (neietekmē mājaslapas iekļaušanu Google meklēšanā) un nav ranžēšanas signāls. Tātad Delfi un TVNET, bloķējot Google-Extended, no AI Overviews nepazūd.

Google lapā par AI funkcijām un jūsu mājaslapu paskaidrots, kāpēc: AI ir iebūvēts meklēšanā un ir tās neatņemama daļa, tāpēc piekļuvi pārvalda ar parastajiem Googlebot noteikumiem robots.txt failā. Ja gribat ierobežot, ko Google rāda, jālieto nosnippet, data-nosnippet, max-snippet vai noindex, un tie tādā pašā mērā ierobežo arī parastos meklēšanas rezultātus.

Google meklēšanā atsevišķa AI slēdža nav. Uzņēmums, kas bloķē Google-Extended, cerot neparādīties AI Overviews, meklēšanā neko nav mainījis.

Uzņēmuma mājaslapai atbilde ir cita

Ziņu portāla raksts ir tas, ko portāls pārdod. Ja AI atbilde rakstu labi apkopo, lasītājs var portālu neatvērt, un tieši apmeklējums nes abonementu vai reklāmas ieņēmumus. Bloķējot, izdevējs sargā produktu un stiprina savu pozīciju sarunās.

Pakalpojumu uzņēmuma lapa ir cita veida teksts. Tā vajadzīga, lai cilvēks, kuram vajag pakalpojumu, uzņēmumu atrastu un sazinātos. Ja AI atbilde šo lapu citē un nosauc uzņēmumu, lapa ir izdarījusi savu darbu, un, aizliedzot crawler, uzņēmums neko nepasargā. Ko atteikums maksā, ražotāji raksta paši, abus dokumentus pārbaudījām 2026. gada 30. septembrī:

  • OpenAI crawler dokumentācijā rakstīts, ka mājaslapas, kas bloķē OAI-SearchBot, ChatGPT meklēšanas atbildēs neparādīsies, ja nu vienīgi kā navigācijas saites.
  • Anthropic lapā par crawler rakstīts, ka Claude-SearchBot atslēgšana neļauj indeksēt jūsu saturu meklēšanai un var samazināt jūsu mājaslapas redzamību lietotāju meklēšanas rezultātos.

Apmācība ir tā daļa, par kuru uzņēmums var lemt jebkurā virzienā, jo ražotāji to nodala. OpenAI to min kā piemēru: mājaslapa var ielaist OAI-SearchBot, lai parādītos meklēšanas rezultātos, un aizliegt GPTBot, lai saturu neizmantotu apmācībai. Vai ar jūsu lapām drīkst apmācīt kāda cita modeli, ir īsts jautājums par jūsu saturu, bet ar to, vai jūs citēs, tas nav saistīts.

No izdevējiem tātad ir vērts pārņemt nevis pašu bloķēšanu, bet to, ka viņi par katru crawler lēma atsevišķi, rakstiski un zinot, ko tas dara.

Vai bloķēt AI robotus, izlemj jūsu teksta mērķis

Jūsu teksts irApmācības crawler (GPTBot, ClaudeBot, Google-Extended)Meklēšanas un lietotāju crawler (OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot)
Produkts: žurnālistika, maksas pētījumi, mācību materiāliAizliegt, ja vien nelicencējatAizliegt vai ielaist tos, ar kuriem esat vienojušies
Piedāvājums: pakalpojumi, B2B, veikals, vietējais uzņēmumsJūsu izvēle, un no tās nav atkarīgs, vai jūs citēsIelaist
Palīdzība klientiem: dokumentācija, atbalsts, instrukcijasJūsu izvēleIelaist, jo tieši šeit klienti tagad jautā

Ja esat pirmajā rindā, jūs esat izdevējs, un robots.txt ir daļa no jūsu biznesa stratēģijas. Gandrīz visi pārējie ir otrajā vai trešajā rindā.

Ko varat izdarīt paši un kad vajag izstrādātāju

To varat iestatīt paši. Atveriet https://jusudomens.lv/robots.txt, paskatieties, kurus no augstāk minētajiem crawler fails nosauc, un katram lēmumam uzrakstiet savu grupu. Ja gribat palikt AI atbildēs, bet neļaut saturu izmantot apmācībai, pietiek ar šīm rindām:

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

Meklēšanas crawler nenosauciet, tad uz tiem attiecas vispārīgie noteikumi. Izmaiņu var atsaukt minūtes laikā.

Izstrādātāju vajag divos gadījumos. Pirmais: fails saka vienu, bet serveris dara citu, jo CDN, ugunsmūris vai drošības spraudnis neielaiž crawler, kurus fails atļauj. Kā to pārbaudīt, aprakstījām rakstā par nejaušu AI bloķēšanu, un tas notiek bieži. Otrais: gribat daļu lapas paslēpt no Google fragmentiem un AI funkcijām, bet ne visu lapu. Tad data-nosnippet jāieliek veidnēs, un ar vienu iestatījumu to izdarīt nevar.

Kāpēc mēs to varam apgalvot

Nozaru skaitļi nāk no Baltijas mājaslapu pētījuma: 2026. gada jūlijā un augustā izmērījām 293 806 no 306 872 Baltijas domēniem, nozari norādām tikai tad, ja klasifikatora ticamība bija vismaz 0,7, un publicējam tikai kopsavilkumus, nevienu mājaslapu nenosaucot. Metode un visa nozaru nodaļa ir pētījumā. Ziņu portālu faili ir to pašu publiskie robots.txt, nolasīti 2026. gada 30. septembrī.

Ja gribat zināt, kā jūsu fails un jūsu serveris izturas pret katru AI crawler un kurš AI meklētājs jūs patiešām citē, to mēra redzamība AI meklējumos.

Pastāstiet, kas nestrādā,
un mēs pateiksim patiesību

Bezmaksas zvans →
Atbildam vienas darba dienas laikā · EN / LV
↑↓ pārvietoties · ↵ atvērt · esc aizvērt