BRONDATA BIJ HET ONDERZOEK NAAR AI-TOEGANG
AI-toegang op de kop van het Nederlandse internet
GEO-Optimaliseren.nl, Tijm de Jong
Gemeten op 2026-09-07

Dit archief bevat alles wat nodig is om de cijfers in het onderzoek na te
rekenen, of om de meting zelf opnieuw te draaien.


WAT ZIT ERIN

robots-ruw/        De robots.txt zoals hij op de peildatum werd uitgeleverd,
                   per organisatie een bestand met de domeinnaam als naam.
                   142 bestanden. Bestanden met .llms.txt in de naam zijn de
                   gevonden llms.txt-bestanden, 13 stuks.

onderzoek3.json    De volledige uitslag. Per organisatie: de Tranco-rang, de
                   sector, elke ophaalpoging met statuscode en user-agent, en
                   per AI-crawler drie oordelen (eigen groep, ster-groep, wat
                   er feitelijk geldt).

code/              De scripts waarmee dit tot stand kwam. Zie hieronder.

nl-tranco.txt      De .nl-domeinen uit de Tranco-ranglijst met hun positie,
                   het startpunt van de selectie.


DE SCRIPTS

selectie.py            De indeling in sectoren en de uitsluitingen, met een reden per domein.
meting3.py             De meting zelf: ophalen, beoordelen en wegschrijven naar onderzoek3.json.
maak-onderzoek3.py     Zet onderzoek3.json om naar het databestand achter de tabellen.
cijfers3.py            Telt alle cijfers uit de meting na, zodat elke bewering te herleiden is.

Draaien in deze volgorde: meting3.py maakt onderzoek3.json, cijfers3.py leest
die en telt na. Python 3.12, alleen de standaardbibliotheek.


HOE DE MEETMETHODE WERKT, IN HET KORT

Een crawler leest alleen de meest specifieke groep die op zijn naam past en
negeert de rest. Staat er een blok "User-agent: GPTBot", dan gelden de regels
onder "User-agent: *" niet meer voor GPTBot. Daarom staat per crawler apart
vastgelegd wat er in zijn eigen groep staat en wat de ster-groep doet: "niet
genoemd" betekent iets anders dan "toegestaan".

Een "Disallow:" zonder waarde betekent dat alles is toegestaan en telt niet
als beperking. Een leeg robots.txt-bestand is een geldig bestand en betekent
dat er geen enkele regel geldt.

Opeenvolgende User-agent-regels horen bij dezelfde groep. Dat is het onderdeel
dat eenvoudige lezers het vaakst fout doen.


WAT ER NIET IN ZIT

De elf organisaties waarvan geen bruikbaar bestand binnenkwam, hebben geen
bestand in robots-ruw/. Hun ophaalpogingen met statuscodes staan wel in
onderzoek3.json.

De 97 vooraf uitgesloten domeinen staan met hun reden in onderzoek3.json en in
het Excel-bestand op de onderzoekspagina. Van hen is geen robots.txt opgehaald.


GEBRUIK

Vrij te gebruiken met bronvermelding. De meting is een momentopname;
robots.txt-bestanden veranderen. Wie de meting herhaalt, krijgt andere
uitkomsten naarmate er meer tijd tussen zit.

https://geo-optimaliseren.nl/onderzoek/ai-toegang-nederlands-internet-2026/
