Spring naar inhoud

Zo is de AI-zichtbaarheidsbenchmark gemeten

De volledige methodologie achter de Nederlandse AI-zichtbaarheidsbenchmark: alle 45 prompts, exacte modelversies, elke definitie, Wilson 95%-betrouwbaarheidsintervallen, en de complete dataset van 1.125 antwoorden als open CC BY 4.0 download.

14 min leestijd

Waarom deze appendix

De AI-zichtbaarheidsbenchmark is onderzoek van een bedrijf dat ook diensten verkoopt op het gebied dat het onderzoekt. Dat heet vendor research, en het is de normaalste zaak van de wereld: Ahrefs, Semrush en HubSpot publiceren op dezelfde manier. Maar het betekent ook dat je mijn cijfers niet op mijn blauwe ogen hoeft te geloven. Je moet ze kunnen narekenen.

Daarom staat op deze pagina alles wat je nodig hebt om de meting te controleren of over te doen: de exacte vragen, de exacte modelversies, de definities achter elke metriek, de onzekerheidsmarges bij elke uitspraak, en de volledige dataset van alle 1.125 antwoorden als vrije download onder een CC BY 4.0 licentie. Niets is samengevat, niets is weggelaten, niets is opgeschoond.

De opzet in cijfers

OnderdeelWaarde
Beroepen3 (architecten, therapeuten, fotografen)
Vragen per beroep15 (10 aanbevelingsvragen, 5 herkenningsvragen)
AI-assistenten5 (ChatGPT, Google Gemini, Perplexity, Claude, Grok)
Herhalingen per vraag5, elk met schone context
Antwoorden per beroep375
Antwoorden totaal1.125
Meetvenster10 juni 2026, 05:20 UTC tot 12 juni 2026, 09:21 UTC

De aanbevelingsvragen verdelen zich per beroep over drie regiolagen: vijf landelijk, drie grootstedelijk, twee regionaal. Elke API-call kreeg een schone context: geen geheugen, geen systeeminstructies, geen sessie-overloop. Tussen calls zat een vaste pauze van twee seconden. Grok is op 12 juni als vijfde platform toegevoegd, nadat een proefrun op de therapeuten-set foutloos bleek; de drie beroepen zijn daarna alle drie volledig op Grok gemeten.

Alle 45 prompts

De promptset is vooraf vastgelegd en tijdens de meting niet aangepast. Dat is controleerbaar in de dataset zelf: elk ruw antwoord bevat de exact verstuurde prompttekst, met tijdstempel. De vragen zijn geformuleerd in natuurlijk koperstaal, zoals een opdrachtgever of cliënt ze werkelijk stelt, niet in vakjargon.

Type A is een categorievraag, type B een probleemvraag waarin de vraagsteller nog niet weet welke specialist hij nodig heeft, type C een naamsverificatie. Bij type C is {expert_name} per run ingevuld met een van de vijf gesamplede experts per beroep.

Architecten

IDTypeRegioPrompt
arch-a-01AlandelijkWie is een goede architect voor circulair bouwen in Nederland?
arch-a-02AlandelijkWelke architecten in Nederland zijn gespecialiseerd in herbestemming van industrieel erfgoed?
arch-a-03AlandelijkIk wil een huis in houtbouw laten ontwerpen. Welke architect raad je aan?
arch-a-04AgrootstedelijkWie is een goede architect in Amsterdam voor een duurzame verbouwing van een jaren 30 woning?
arch-a-05AgrootstedelijkWelke architectenbureaus in Rotterdam zijn goed in het transformeren van kantoorpanden naar woningen?
arch-a-06AregionaalIk zoek een architect in de regio Breda voor een nieuwbouwwoning in hout. Wie kun je aanraden?
arch-b-01BlandelijkOns pand uit de jaren vijftig moet verduurzaamd worden. Wat voor expert heb ik daarvoor nodig en wie doet dit goed?
arch-b-02BregionaalWe willen onze oude boerderij in Brabant herbestemmen tot een plek om te wonen en te werken. Welke specialist moet ik inschakelen en wie is daar goed in?
arch-b-03BlandelijkOnze kerk staat leeg en de gemeente wil er een nieuwe functie aan geven. Wie kan ons hierbij helpen?
arch-b-04BgrootstedelijkIk wil een aanbouw aan mijn huis met zo min mogelijk milieubelasting. Wat voor expert zoek ik en wie zou je aanbevelen in de buurt van Rotterdam?
arch-c-01 t/m 05ClandelijkWie is {expert_name}?

Therapeuten

IDTypeRegioPrompt
ther-a-01AlandelijkWie is een goede traumatherapeut met EMDR in Nederland?
ther-a-02AlandelijkIk zoek een relatietherapeut voor mij en mijn partner. Wie raad je aan in Nederland?
ther-a-03AlandelijkWelke psycholoog in Nederland is gespecialiseerd in burn-out en overspannenheid?
ther-a-04AgrootstedelijkWie is een goede psycholoog in Amsterdam voor de behandeling van angst- en paniekklachten?
ther-a-05AgrootstedelijkWelke therapeut in Rotterdam is goed in het behandelen van trauma en PTSS?
ther-a-06AregionaalIk zoek in de regio Breda een relatietherapeut. Wie kun je aanraden?
ther-b-01BlandelijkSinds een ingrijpende gebeurtenis slaap ik slecht en schrik ik overal van. Wat voor hulp heb ik nodig en wie is daar goed in?
ther-b-02BregionaalHet loopt al tijden stroef tussen mij en mijn partner en we komen er samen niet uit. Welke specialist moet ik inschakelen en wie is daar goed in in de regio Eindhoven?
ther-b-03BlandelijkIk ben volledig opgebrand door mijn werk en mijn huisarts adviseert begeleiding. Wat voor expert heb ik daarvoor nodig en wie doet dit goed?
ther-b-04BgrootstedelijkIk krijg steeds vaker paniekaanvallen en ga situaties uit de weg. Wat voor hulpverlener moet ik zoeken en wie zou je aanbevelen in de buurt van Rotterdam?
ther-c-01 t/m 05ClandelijkWie is {expert_name}?

Fotografen

IDTypeRegioPrompt
pho-a-01AlandelijkWie is een goede trouwfotograaf in Nederland?
pho-a-02AlandelijkWelke fotograaf in Nederland is gespecialiseerd in familie- en portretfotografie?
pho-a-03AlandelijkIk zoek een fotograaf voor zakelijke portretten en personal branding. Wie raad je aan in Nederland?
pho-a-04AgrootstedelijkWie is een goede bruiloftsfotograaf in Amsterdam?
pho-a-05AgrootstedelijkWelke fotograaf in Rotterdam is goed in zakelijke bedrijfs- en brandingfotografie?
pho-a-06AregionaalWie is een goede trouwfotograaf in de regio Breda?
pho-b-01BlandelijkWe gaan volgend jaar trouwen en willen de dag mooi laten vastleggen. Wat voor fotograaf zoeken we en wie is daar goed in?
pho-b-02BregionaalWe willen graag professionele foto's van ons gezin laten maken nu de kinderen nog klein zijn. Welke specialist kunnen we daarvoor het beste inschakelen en wie is daar goed in in de regio Eindhoven?
pho-b-03BlandelijkIk start een eigen bedrijf en heb professionele foto's nodig van mezelf en mijn werk voor mijn website en LinkedIn. Wat voor fotograaf heb ik daarvoor nodig en wie doet dit goed?
pho-b-04BgrootstedelijkMijn ouders zijn veertig jaar getrouwd en we geven een groot feest dat we graag willen laten vastleggen. Wat voor fotograaf zoek ik en wie zou je aanbevelen in de buurt van Rotterdam?
pho-c-01 t/m 05ClandelijkWie is {expert_name}?

Modellen en instellingen

Alle vijf assistenten zijn via hun API bevraagd, met web search of grounding aangezet, zoals de gemiddelde gebruiker ze in de consumentenapp heeft. De tabel toont zowel de geconfigureerde modelnaam als de modelversie die de API zelf per antwoord terugrapporteerde. Die laatste is per individueel antwoord vastgelegd in het veld model_reported en is de waarheid; modellen verschuiven onder je handen.

PlatformGeconfigureerdGerapporteerd door de APIZoekfunctie
ChatGPTgpt-5gpt-5-2025-08-07web search aan
Google Geminigemini-flash-latestgemini-3.5-flashsearch grounding aan
Perplexitysonarsonaringebouwd
Claudesonnetclaude-sonnet-4-6web search aan
Grokgrok-4.3grok-4.3web en X live search aan

Twee eerlijke voetnoten. De Claude-metingen liepen via de officiële CLI; bij 149 van de 225 Claude-antwoorden rapporteert die naast Sonnet ook een intern hulpmodel (claude-haiku-4-5), dat niet het antwoord schreef maar CLI-gereedschap aanstuurde. Dat staat zichtbaar in de data in plaats van weggepoetst. En de Gemini-configuratie gebruikte de alias gemini-flash-latest, die in het meetvenster naar gemini-3.5-flash wees; sinds juli pinnen we op de expliciete versienaam, omdat een alias midden in een venster kan verspringen.

De steekproef

Per beroep is een steekproef van experts samengesteld via uitsluitend neutrale bronnen: beroepsregisters, brancheorganisaties en vakmedia, waaronder de BNA, de Vereniging EMDR Nederland, de NVRG, het NIP, DuPho, het BIG-register en vakbladen als De Architect en Het Houtblad. Nadrukkelijk niet via AI-suggesties, want dan meet je wat AI al kent, en niet uit mijn eigen netwerk, want dan meet je wie ik al ken. Elke lijst is vooraf met de hand gereviewd.

Voor de herkenningsvragen (type C) zijn per beroep vijf experts geselecteerd, gespreid over bekendheid: één landelijk prominent, twee middenveld, twee met een klein publiek profiel. Van elke expert is een entiteitssnapshot vastgelegd: eigen domein, schema.org aanwezig, Wikipedia en Wikidata, activiteit op LinkedIn, vermeldingen in vakmedia en naamsambiguïteit. Die snapshots staan integraal in de dataset, zodat je de relatie tussen entiteitspositie en herkenning zelf kunt toetsen.

Definities

Elke metriek in het rapport rust op een expliciete definitie. Dit zijn ze.

  • Antwoord met naam. Een aanbevelingsantwoord (type A of B) telt als "met naam" wanneer er minstens één concrete persoon of organisatie uit geëxtraheerd is en het geen weigering is. Generiek advies zonder namen telt niet.
  • Vermelding. Eén genoemde persoon of organisatie in één antwoord, na normalisatie van de naam (kleine letters, accenten en leestekens verwijderd). De kernmetriek is frequentie over de vijf herhaalruns van dezelfde vraag: in hoeveel van de vijf runs verschijnt expert X?
  • Consistentie. Jaccard-overlap van de verzameling genoemde entiteiten tussen identieke herhaalruns van dezelfde vraag op hetzelfde platform.
  • Herkend (type C). Het antwoord beschrijft aantoonbaar ónze gesamplede expert, met de hand geverifieerd op praktijk, regio en beroep. Een antwoord dat een naamgenoot beschrijft, of een overtuigend klinkende maar verzonnen persoon, telt als niet herkend. Alle 375 herkenningsantwoorden zijn handmatig beoordeeld. Het oorspronkelijke, automatisch geëxtraheerde herkenningsveld staat naast het handmatige oordeel in de dataset, zodat je precies kunt zien waar beide verschillen en waarom die handmatige stap nodig was.

De extractie van personen, organisaties en bronlinks uit de antwoorden is gedaan door een taalmodel (claude-sonnet-4-6). De eerste vijftig extracties per beroep zijn met de hand gevalideerd voordat de rest werd verwerkt.

Onzekerheid: betrouwbaarheidsintervallen

AI-antwoorden variëren, en een steekproef is een steekproef. Elk percentage in het rapport heeft dus een onzekerheidsmarge, en die hoort erbij. Hieronder de Wilson 95%-betrouwbaarheidsintervallen voor de kerncijfers. Lees ze zo: als het interval breed is, is het puntcijfer een indicatie, geen precisie-instrument.

Naamratio per platform (aandeel aanbevelingsantwoorden met minstens één naam, n=50 per cel)

PlatformArchitectenTherapeutenFotografen
ChatGPT80,0% (67,0 tot 88,8)92,0% (81,2 tot 96,9)86,0% (73,8 tot 93,0)
Gemini100% (92,9 tot 100)100% (92,9 tot 100)100% (92,9 tot 100)
Perplexity98,0% (89,5 tot 99,7)90,0% (78,6 tot 95,7)100% (92,9 tot 100)
Claude100% (92,9 tot 100)94,0% (83,8 tot 97,9)94,0% (83,8 tot 97,9)
Grok100% (92,9 tot 100)100% (92,9 tot 100)100% (92,9 tot 100)
Alle vijf samen (n=250)95,6% (92,3 tot 97,5)95,2% (91,8 tot 97,2)96,0% (92,8 tot 97,8)

Herkenning van de juiste persoon per expert (n=25 per expert)

BeroepExpertHerkendAandeel95%-interval
ArchitectenThomas Rau25/25100%86,7 tot 100
ArchitectenDaan Bruggink25/25100%86,7 tot 100
ArchitectenJanneke Bierman25/25100%86,7 tot 100
ArchitectenSander van Sambeek24/2596,0%80,5 tot 99,3
ArchitectenBart Spee10/2540,0%23,4 tot 59,3
TherapeutenCarien Karsten25/25100%86,7 tot 100
TherapeutenGerard Dikschei25/25100%86,7 tot 100
TherapeutenAnneke Notermans24/2596,0%80,5 tot 99,3
TherapeutenStefi van de Graaf23/2592,0%75,0 tot 97,8
TherapeutenCora van Dijk5/2520,0%8,9 tot 39,1
FotografenMarie Cecile Thijs25/25100%86,7 tot 100
FotografenCarin Deben25/25100%86,7 tot 100
FotografenDenise Motz24/2596,0%80,5 tot 99,3
FotografenAnniek Snoeijs23/2592,0%75,0 tot 97,8
FotografenAstrid Mitchell14/2556,0%37,1 tot 73,3

Wat deze intervallen betekenen voor de conclusies: bij n=25 per expert zijn de marges fors, en een enkel percentage per expert moet je dus niet op de komma nemen. De uitspraken in het rapport rusten daarom niet op individuele puntcijfers maar op patronen die in alle drie de beroepen tegelijk optreden. Dat in elk beroep precies de expert met een beroemde naamgenoot instort terwijl experts met een eenduidige naam vrijwel foutloos herkend worden, is met deze intervallen ruimschoots onderscheidbaar: de intervallen van Bart Spee (23,4 tot 59,3) en Cora van Dijk (8,9 tot 39,1) overlappen nergens met die van de foutloos herkende experts (86,7 tot 100).

De intervallen per platform en de herkenningscijfers per platform staan in het bestand confidence-intervals.json in de dataset, berekend met exact dezelfde definities als het rapport.

De volledige dataset

Alle 1.125 antwoorden zijn openbaar, onbewerkt en machineleesbaar, onder een CC BY 4.0 licentie. Je mag ze hergebruiken, herverdelen en erop voortbouwen, met bronvermelding. Elke claim in het rapport is tegen deze bestanden na te rekenen.

BestandInhoudOmvang
answers.jsonlAlle 1.125 antwoorden: volledige antwoordtekst, prompt, platform, gerapporteerde modelversie, tijdstempel, run-index, geciteerde URL's4,7 MB
answers-full.jsonl.gzDezelfde 1.125 antwoorden met de complete, onaangeraakte API-envelop per antwoord: het primaire bewijs3,7 MB
extracted.jsonlPer antwoord de geëxtraheerde personen, organisaties en bronlinks, plus het handmatige herkenningsoordeel3,0 MB
prompts.jsonAlle 45 prompts met type, regiolaag en exacte formulering14 kB
experts.jsonDe expertsteekproef per beroep: selectiebronnen, bekendheidsniveau, entiteitssnapshot78 kB
confidence-intervals.jsonWilson 95%-intervallen voor alle kernproporties6 kB
manifest.jsonAantallen, bestandsgroottes en SHA-256 checksums van elk bestand1 kB
README.mdDatasheet: schema per bestand, definities, licentie, citatie7 kB

De checksums in manifest.json maken elk bestand verifieerbaar: wie een bestand downloadt, kan controleren dat het byte voor byte het origineel is.

Citatie: Identity First Media (2026). NL AI Visibility Benchmark, nulmeting Q2 2026.

Wat dit onderzoek wel en niet is

Dit is vendor research: uitgevoerd door Identity First Media, dat diensten verkoopt op het gebied van AI-vindbaarheid. Die dubbele rol verdwijnt niet door haar te verzwijgen, maar door haar te compenseren met controleerbaarheid. Vandaar deze appendix, de open dataset en de vaste eerlijkheidsparagraaf die met elke publicatie meegaat.

Wat dit onderzoek is: een navolgbare nulmeting van AI-zichtbaarheid van Nederlandse domeinexperts, met elke ruwe waarneming bewaard en gepubliceerd.

Wat het niet is: onafhankelijk gevalideerd onderzoek. Dat wordt het pas wanneer iemand anders de meting overdoet en vergelijkbare patronen vindt. De promptset, de expertsteekproef en de modelconfiguratie in de dataset zijn daarvoor voldoende. Wie de meting herhaalt tegen de dan actuele modelgeneratie, moet andere absolute getallen verwachten, want modellen veranderen continu. De structurele patronen zijn de claim, niet de puntschattingen. Wie hem overdoet en iets anders vindt, publiceren we er net zo lief naast.

De overige grenzen van de meting, waaronder het verschil tussen API en consumentenapp, staan in het hoofdrapport.

Verder lezen

Dit is de methodologie-appendix bij de Nederlandse AI-zichtbaarheidsbenchmark. Achtergrond bij het kernbegrip: wat is een entiteit?

Bronnen

  1. Open dataset (Q2 2026)
  2. CC BY 4.0

Gerelateerde artikelen