Zo is de AI-zichtbaarheidsbenchmark gemeten
De volledige methodologie achter de Nederlandse AI-zichtbaarheidsbenchmark: alle 45 prompts, exacte modelversies, elke definitie, Wilson 95%-betrouwbaarheidsintervallen, en de complete dataset van 1.125 antwoorden als open CC BY 4.0 download.
Inhoudsopgave
Waarom deze appendix
De AI-zichtbaarheidsbenchmark is onderzoek van een bedrijf dat ook diensten verkoopt op het gebied dat het onderzoekt. Dat heet vendor research, en het is de normaalste zaak van de wereld: Ahrefs, Semrush en HubSpot publiceren op dezelfde manier. Maar het betekent ook dat je mijn cijfers niet op mijn blauwe ogen hoeft te geloven. Je moet ze kunnen narekenen.
Daarom staat op deze pagina alles wat je nodig hebt om de meting te controleren of over te doen: de exacte vragen, de exacte modelversies, de definities achter elke metriek, de onzekerheidsmarges bij elke uitspraak, en de volledige dataset van alle 1.125 antwoorden als vrije download onder een CC BY 4.0 licentie. Niets is samengevat, niets is weggelaten, niets is opgeschoond.
De opzet in cijfers
| Onderdeel | Waarde |
|---|---|
| Beroepen | 3 (architecten, therapeuten, fotografen) |
| Vragen per beroep | 15 (10 aanbevelingsvragen, 5 herkenningsvragen) |
| AI-assistenten | 5 (ChatGPT, Google Gemini, Perplexity, Claude, Grok) |
| Herhalingen per vraag | 5, elk met schone context |
| Antwoorden per beroep | 375 |
| Antwoorden totaal | 1.125 |
| Meetvenster | 10 juni 2026, 05:20 UTC tot 12 juni 2026, 09:21 UTC |
De aanbevelingsvragen verdelen zich per beroep over drie regiolagen: vijf landelijk, drie grootstedelijk, twee regionaal. Elke API-call kreeg een schone context: geen geheugen, geen systeeminstructies, geen sessie-overloop. Tussen calls zat een vaste pauze van twee seconden. Grok is op 12 juni als vijfde platform toegevoegd, nadat een proefrun op de therapeuten-set foutloos bleek; de drie beroepen zijn daarna alle drie volledig op Grok gemeten.
Alle 45 prompts
De promptset is vooraf vastgelegd en tijdens de meting niet aangepast. Dat is controleerbaar in de dataset zelf: elk ruw antwoord bevat de exact verstuurde prompttekst, met tijdstempel. De vragen zijn geformuleerd in natuurlijk koperstaal, zoals een opdrachtgever of cliënt ze werkelijk stelt, niet in vakjargon.
Type A is een categorievraag, type B een probleemvraag waarin de vraagsteller nog niet weet welke specialist hij nodig heeft, type C een naamsverificatie. Bij type C is {expert_name} per run ingevuld met een van de vijf gesamplede experts per beroep.
Architecten
| ID | Type | Regio | Prompt |
|---|---|---|---|
| arch-a-01 | A | landelijk | Wie is een goede architect voor circulair bouwen in Nederland? |
| arch-a-02 | A | landelijk | Welke architecten in Nederland zijn gespecialiseerd in herbestemming van industrieel erfgoed? |
| arch-a-03 | A | landelijk | Ik wil een huis in houtbouw laten ontwerpen. Welke architect raad je aan? |
| arch-a-04 | A | grootstedelijk | Wie is een goede architect in Amsterdam voor een duurzame verbouwing van een jaren 30 woning? |
| arch-a-05 | A | grootstedelijk | Welke architectenbureaus in Rotterdam zijn goed in het transformeren van kantoorpanden naar woningen? |
| arch-a-06 | A | regionaal | Ik zoek een architect in de regio Breda voor een nieuwbouwwoning in hout. Wie kun je aanraden? |
| arch-b-01 | B | landelijk | Ons pand uit de jaren vijftig moet verduurzaamd worden. Wat voor expert heb ik daarvoor nodig en wie doet dit goed? |
| arch-b-02 | B | regionaal | We willen onze oude boerderij in Brabant herbestemmen tot een plek om te wonen en te werken. Welke specialist moet ik inschakelen en wie is daar goed in? |
| arch-b-03 | B | landelijk | Onze kerk staat leeg en de gemeente wil er een nieuwe functie aan geven. Wie kan ons hierbij helpen? |
| arch-b-04 | B | grootstedelijk | Ik wil een aanbouw aan mijn huis met zo min mogelijk milieubelasting. Wat voor expert zoek ik en wie zou je aanbevelen in de buurt van Rotterdam? |
| arch-c-01 t/m 05 | C | landelijk | Wie is {expert_name}? |
Therapeuten
| ID | Type | Regio | Prompt |
|---|---|---|---|
| ther-a-01 | A | landelijk | Wie is een goede traumatherapeut met EMDR in Nederland? |
| ther-a-02 | A | landelijk | Ik zoek een relatietherapeut voor mij en mijn partner. Wie raad je aan in Nederland? |
| ther-a-03 | A | landelijk | Welke psycholoog in Nederland is gespecialiseerd in burn-out en overspannenheid? |
| ther-a-04 | A | grootstedelijk | Wie is een goede psycholoog in Amsterdam voor de behandeling van angst- en paniekklachten? |
| ther-a-05 | A | grootstedelijk | Welke therapeut in Rotterdam is goed in het behandelen van trauma en PTSS? |
| ther-a-06 | A | regionaal | Ik zoek in de regio Breda een relatietherapeut. Wie kun je aanraden? |
| ther-b-01 | B | landelijk | Sinds een ingrijpende gebeurtenis slaap ik slecht en schrik ik overal van. Wat voor hulp heb ik nodig en wie is daar goed in? |
| ther-b-02 | B | regionaal | Het loopt al tijden stroef tussen mij en mijn partner en we komen er samen niet uit. Welke specialist moet ik inschakelen en wie is daar goed in in de regio Eindhoven? |
| ther-b-03 | B | landelijk | Ik ben volledig opgebrand door mijn werk en mijn huisarts adviseert begeleiding. Wat voor expert heb ik daarvoor nodig en wie doet dit goed? |
| ther-b-04 | B | grootstedelijk | Ik krijg steeds vaker paniekaanvallen en ga situaties uit de weg. Wat voor hulpverlener moet ik zoeken en wie zou je aanbevelen in de buurt van Rotterdam? |
| ther-c-01 t/m 05 | C | landelijk | Wie is {expert_name}? |
Fotografen
| ID | Type | Regio | Prompt |
|---|---|---|---|
| pho-a-01 | A | landelijk | Wie is een goede trouwfotograaf in Nederland? |
| pho-a-02 | A | landelijk | Welke fotograaf in Nederland is gespecialiseerd in familie- en portretfotografie? |
| pho-a-03 | A | landelijk | Ik zoek een fotograaf voor zakelijke portretten en personal branding. Wie raad je aan in Nederland? |
| pho-a-04 | A | grootstedelijk | Wie is een goede bruiloftsfotograaf in Amsterdam? |
| pho-a-05 | A | grootstedelijk | Welke fotograaf in Rotterdam is goed in zakelijke bedrijfs- en brandingfotografie? |
| pho-a-06 | A | regionaal | Wie is een goede trouwfotograaf in de regio Breda? |
| pho-b-01 | B | landelijk | We gaan volgend jaar trouwen en willen de dag mooi laten vastleggen. Wat voor fotograaf zoeken we en wie is daar goed in? |
| pho-b-02 | B | regionaal | We willen graag professionele foto's van ons gezin laten maken nu de kinderen nog klein zijn. Welke specialist kunnen we daarvoor het beste inschakelen en wie is daar goed in in de regio Eindhoven? |
| pho-b-03 | B | landelijk | Ik start een eigen bedrijf en heb professionele foto's nodig van mezelf en mijn werk voor mijn website en LinkedIn. Wat voor fotograaf heb ik daarvoor nodig en wie doet dit goed? |
| pho-b-04 | B | grootstedelijk | Mijn ouders zijn veertig jaar getrouwd en we geven een groot feest dat we graag willen laten vastleggen. Wat voor fotograaf zoek ik en wie zou je aanbevelen in de buurt van Rotterdam? |
| pho-c-01 t/m 05 | C | landelijk | Wie is {expert_name}? |
Modellen en instellingen
Alle vijf assistenten zijn via hun API bevraagd, met web search of grounding aangezet, zoals de gemiddelde gebruiker ze in de consumentenapp heeft. De tabel toont zowel de geconfigureerde modelnaam als de modelversie die de API zelf per antwoord terugrapporteerde. Die laatste is per individueel antwoord vastgelegd in het veld model_reported en is de waarheid; modellen verschuiven onder je handen.
| Platform | Geconfigureerd | Gerapporteerd door de API | Zoekfunctie |
|---|---|---|---|
| ChatGPT | gpt-5 | gpt-5-2025-08-07 | web search aan |
| Google Gemini | gemini-flash-latest | gemini-3.5-flash | search grounding aan |
| Perplexity | sonar | sonar | ingebouwd |
| Claude | sonnet | claude-sonnet-4-6 | web search aan |
| Grok | grok-4.3 | grok-4.3 | web en X live search aan |
Twee eerlijke voetnoten. De Claude-metingen liepen via de officiële CLI; bij 149 van de 225 Claude-antwoorden rapporteert die naast Sonnet ook een intern hulpmodel (claude-haiku-4-5), dat niet het antwoord schreef maar CLI-gereedschap aanstuurde. Dat staat zichtbaar in de data in plaats van weggepoetst. En de Gemini-configuratie gebruikte de alias gemini-flash-latest, die in het meetvenster naar gemini-3.5-flash wees; sinds juli pinnen we op de expliciete versienaam, omdat een alias midden in een venster kan verspringen.
De steekproef
Per beroep is een steekproef van experts samengesteld via uitsluitend neutrale bronnen: beroepsregisters, brancheorganisaties en vakmedia, waaronder de BNA, de Vereniging EMDR Nederland, de NVRG, het NIP, DuPho, het BIG-register en vakbladen als De Architect en Het Houtblad. Nadrukkelijk niet via AI-suggesties, want dan meet je wat AI al kent, en niet uit mijn eigen netwerk, want dan meet je wie ik al ken. Elke lijst is vooraf met de hand gereviewd.
Voor de herkenningsvragen (type C) zijn per beroep vijf experts geselecteerd, gespreid over bekendheid: één landelijk prominent, twee middenveld, twee met een klein publiek profiel. Van elke expert is een entiteitssnapshot vastgelegd: eigen domein, schema.org aanwezig, Wikipedia en Wikidata, activiteit op LinkedIn, vermeldingen in vakmedia en naamsambiguïteit. Die snapshots staan integraal in de dataset, zodat je de relatie tussen entiteitspositie en herkenning zelf kunt toetsen.
Definities
Elke metriek in het rapport rust op een expliciete definitie. Dit zijn ze.
- Antwoord met naam. Een aanbevelingsantwoord (type A of B) telt als "met naam" wanneer er minstens één concrete persoon of organisatie uit geëxtraheerd is en het geen weigering is. Generiek advies zonder namen telt niet.
- Vermelding. Eén genoemde persoon of organisatie in één antwoord, na normalisatie van de naam (kleine letters, accenten en leestekens verwijderd). De kernmetriek is frequentie over de vijf herhaalruns van dezelfde vraag: in hoeveel van de vijf runs verschijnt expert X?
- Consistentie. Jaccard-overlap van de verzameling genoemde entiteiten tussen identieke herhaalruns van dezelfde vraag op hetzelfde platform.
- Herkend (type C). Het antwoord beschrijft aantoonbaar ónze gesamplede expert, met de hand geverifieerd op praktijk, regio en beroep. Een antwoord dat een naamgenoot beschrijft, of een overtuigend klinkende maar verzonnen persoon, telt als niet herkend. Alle 375 herkenningsantwoorden zijn handmatig beoordeeld. Het oorspronkelijke, automatisch geëxtraheerde herkenningsveld staat naast het handmatige oordeel in de dataset, zodat je precies kunt zien waar beide verschillen en waarom die handmatige stap nodig was.
De extractie van personen, organisaties en bronlinks uit de antwoorden is gedaan door een taalmodel (claude-sonnet-4-6). De eerste vijftig extracties per beroep zijn met de hand gevalideerd voordat de rest werd verwerkt.
Onzekerheid: betrouwbaarheidsintervallen
AI-antwoorden variëren, en een steekproef is een steekproef. Elk percentage in het rapport heeft dus een onzekerheidsmarge, en die hoort erbij. Hieronder de Wilson 95%-betrouwbaarheidsintervallen voor de kerncijfers. Lees ze zo: als het interval breed is, is het puntcijfer een indicatie, geen precisie-instrument.
Naamratio per platform (aandeel aanbevelingsantwoorden met minstens één naam, n=50 per cel)
| Platform | Architecten | Therapeuten | Fotografen |
|---|---|---|---|
| ChatGPT | 80,0% (67,0 tot 88,8) | 92,0% (81,2 tot 96,9) | 86,0% (73,8 tot 93,0) |
| Gemini | 100% (92,9 tot 100) | 100% (92,9 tot 100) | 100% (92,9 tot 100) |
| Perplexity | 98,0% (89,5 tot 99,7) | 90,0% (78,6 tot 95,7) | 100% (92,9 tot 100) |
| Claude | 100% (92,9 tot 100) | 94,0% (83,8 tot 97,9) | 94,0% (83,8 tot 97,9) |
| Grok | 100% (92,9 tot 100) | 100% (92,9 tot 100) | 100% (92,9 tot 100) |
| Alle vijf samen (n=250) | 95,6% (92,3 tot 97,5) | 95,2% (91,8 tot 97,2) | 96,0% (92,8 tot 97,8) |
Herkenning van de juiste persoon per expert (n=25 per expert)
| Beroep | Expert | Herkend | Aandeel | 95%-interval |
|---|---|---|---|---|
| Architecten | Thomas Rau | 25/25 | 100% | 86,7 tot 100 |
| Architecten | Daan Bruggink | 25/25 | 100% | 86,7 tot 100 |
| Architecten | Janneke Bierman | 25/25 | 100% | 86,7 tot 100 |
| Architecten | Sander van Sambeek | 24/25 | 96,0% | 80,5 tot 99,3 |
| Architecten | Bart Spee | 10/25 | 40,0% | 23,4 tot 59,3 |
| Therapeuten | Carien Karsten | 25/25 | 100% | 86,7 tot 100 |
| Therapeuten | Gerard Dikschei | 25/25 | 100% | 86,7 tot 100 |
| Therapeuten | Anneke Notermans | 24/25 | 96,0% | 80,5 tot 99,3 |
| Therapeuten | Stefi van de Graaf | 23/25 | 92,0% | 75,0 tot 97,8 |
| Therapeuten | Cora van Dijk | 5/25 | 20,0% | 8,9 tot 39,1 |
| Fotografen | Marie Cecile Thijs | 25/25 | 100% | 86,7 tot 100 |
| Fotografen | Carin Deben | 25/25 | 100% | 86,7 tot 100 |
| Fotografen | Denise Motz | 24/25 | 96,0% | 80,5 tot 99,3 |
| Fotografen | Anniek Snoeijs | 23/25 | 92,0% | 75,0 tot 97,8 |
| Fotografen | Astrid Mitchell | 14/25 | 56,0% | 37,1 tot 73,3 |
Wat deze intervallen betekenen voor de conclusies: bij n=25 per expert zijn de marges fors, en een enkel percentage per expert moet je dus niet op de komma nemen. De uitspraken in het rapport rusten daarom niet op individuele puntcijfers maar op patronen die in alle drie de beroepen tegelijk optreden. Dat in elk beroep precies de expert met een beroemde naamgenoot instort terwijl experts met een eenduidige naam vrijwel foutloos herkend worden, is met deze intervallen ruimschoots onderscheidbaar: de intervallen van Bart Spee (23,4 tot 59,3) en Cora van Dijk (8,9 tot 39,1) overlappen nergens met die van de foutloos herkende experts (86,7 tot 100).
De intervallen per platform en de herkenningscijfers per platform staan in het bestand confidence-intervals.json in de dataset, berekend met exact dezelfde definities als het rapport.
De volledige dataset
Alle 1.125 antwoorden zijn openbaar, onbewerkt en machineleesbaar, onder een CC BY 4.0 licentie. Je mag ze hergebruiken, herverdelen en erop voortbouwen, met bronvermelding. Elke claim in het rapport is tegen deze bestanden na te rekenen.
| Bestand | Inhoud | Omvang |
|---|---|---|
| answers.jsonl | Alle 1.125 antwoorden: volledige antwoordtekst, prompt, platform, gerapporteerde modelversie, tijdstempel, run-index, geciteerde URL's | 4,7 MB |
| answers-full.jsonl.gz | Dezelfde 1.125 antwoorden met de complete, onaangeraakte API-envelop per antwoord: het primaire bewijs | 3,7 MB |
| extracted.jsonl | Per antwoord de geëxtraheerde personen, organisaties en bronlinks, plus het handmatige herkenningsoordeel | 3,0 MB |
| prompts.json | Alle 45 prompts met type, regiolaag en exacte formulering | 14 kB |
| experts.json | De expertsteekproef per beroep: selectiebronnen, bekendheidsniveau, entiteitssnapshot | 78 kB |
| confidence-intervals.json | Wilson 95%-intervallen voor alle kernproporties | 6 kB |
| manifest.json | Aantallen, bestandsgroottes en SHA-256 checksums van elk bestand | 1 kB |
| README.md | Datasheet: schema per bestand, definities, licentie, citatie | 7 kB |
De checksums in manifest.json maken elk bestand verifieerbaar: wie een bestand downloadt, kan controleren dat het byte voor byte het origineel is.
Citatie: Identity First Media (2026). NL AI Visibility Benchmark, nulmeting Q2 2026.
Wat dit onderzoek wel en niet is
Dit is vendor research: uitgevoerd door Identity First Media, dat diensten verkoopt op het gebied van AI-vindbaarheid. Die dubbele rol verdwijnt niet door haar te verzwijgen, maar door haar te compenseren met controleerbaarheid. Vandaar deze appendix, de open dataset en de vaste eerlijkheidsparagraaf die met elke publicatie meegaat.
Wat dit onderzoek is: een navolgbare nulmeting van AI-zichtbaarheid van Nederlandse domeinexperts, met elke ruwe waarneming bewaard en gepubliceerd.
Wat het niet is: onafhankelijk gevalideerd onderzoek. Dat wordt het pas wanneer iemand anders de meting overdoet en vergelijkbare patronen vindt. De promptset, de expertsteekproef en de modelconfiguratie in de dataset zijn daarvoor voldoende. Wie de meting herhaalt tegen de dan actuele modelgeneratie, moet andere absolute getallen verwachten, want modellen veranderen continu. De structurele patronen zijn de claim, niet de puntschattingen. Wie hem overdoet en iets anders vindt, publiceren we er net zo lief naast.
De overige grenzen van de meting, waaronder het verschil tussen API en consumentenapp, staan in het hoofdrapport.
Verder lezen
Dit is de methodologie-appendix bij de Nederlandse AI-zichtbaarheidsbenchmark. Achtergrond bij het kernbegrip: wat is een entiteit?