# Hallucinaties meten: hoe test je de feitelijkheid van een

[Naar de inhoud](#lm-inhoud)Netwerk/NL[EN](/en/hallucinaties-meten)[Hubhub.llmnet.nlModellen vergelijken op taak, taal, kosten en licentie.](https://hub.llmnet.nl/)[Communitycommunity.llmnet.nlPrompttechnieken, patronen en systeemprompts.](https://community.llmnet.nl/)[APIapi.llmnet.nlLLM's robuust in software: rate limits, routing, structured output.](https://api.llmnet.nl/)[Consultancyconsultancy.llmnet.nlAI invoeren in een organisatie, van pilot tot productie.](https://consultancy.llmnet.nl/)[Nieuwsnieuws.llmnet.nlOntwikkelingen in AI, geduid voor Nederland.](https://nieuws.llmnet.nl/)[Benchmarkbenchmark.llmnet.nlZelf meten wat AI-kwaliteit is, voor jouw taken.](https://benchmark.llmnet.nl/)[Vacaturesvacatures.llmnet.nlAI-rollen, salarissen en carrièrepaden in Nederland.](https://vacatures.llmnet.nl/)[Lerenleren.llmnet.nlAI-concepten in gewoon Nederlands, van beginner tot bouwer.](https://leren.llmnet.nl/)[Gidsgids.llmnet.nlAI privé draaien op eigen Mac, pc, NAS of thuisserver.](https://gids.llmnet.nl/)[Directorydirectory.llmnet.nlHet AI-ecosysteem in kaart: tools, modellen, bedrijven.](https://directory.llmnet.nl/)[Radarradar.llmnet.nlSignalen uit X, onderzoek en communities voor indie developers.](https://radar.llmnet.nl/)[Appsapps.llmnet.nlReviews van AI-apps en open-source repo's, met tips voor wie zelf bouwt.](https://apps.llmnet.nl/)[llmnet.nl — hoofdsite](https://llmnet.nl/)[](https://x.com/intent/post?url=https%3A%2F%2Fbenchmark.llmnet.nl%2Fhallucinaties-meten&text=Hallucinaties%20meten%3A%20hoe%20test%20je%20de%20feitelijkheid%20van%20een)[](https://www.linkedin.com/sharing/share-offsite/?url=https%3A%2F%2Fbenchmark.llmnet.nl%2Fhallucinaties-meten)[](https://www.reddit.com/submit?url=https%3A%2F%2Fbenchmark.llmnet.nl%2Fhallucinaties-meten&title=Hallucinaties%20meten%3A%20hoe%20test%20je%20de%20feitelijkheid%20van%20een)[](#)[](https://x.com/intent/post?url=https%3A%2F%2Fbenchmark.llmnet.nl%2Fhallucinaties-meten&text=Hallucinaties%20meten%3A%20hoe%20test%20je%20de%20feitelijkheid%20van%20een)[](https://www.linkedin.com/sharing/share-offsite/?url=https%3A%2F%2Fbenchmark.llmnet.nl%2Fhallucinaties-meten)[](https://www.reddit.com/submit?url=https%3A%2F%2Fbenchmark.llmnet.nl%2Fhallucinaties-meten&title=Hallucinaties%20meten%3A%20hoe%20test%20je%20de%20feitelijkheid%20van%20een)[](#)Door Ivo Donker — samengesteld met AI-ondersteuning (Claude & Gemini) · Laatst bijgewerkt: 27 juli 2026

# Hallucinaties meten: hoe test je de feitelijkheid van een LLM?

Een gids voor ontwikkelaars en data-engineers over het kwantificeren van model-betrouwbaarheid.

## Wat is een hallucinatie in een LLM?

Een hallucinatie treedt op wanneer een Large Language Model (LLM) tekst genereert die syntactisch en semantisch aannemelijk klinkt, maar feitelijk onjuist is of niet logisch voortvloeit uit de meegegeven context. In de context van bedrijfsapplicaties vormen hallucinaties het grootste obstakel voor veilige en betrouwbare inzetbaarheid.

## Meetmethodes op hoofdlijnen

Het structureel meten van deze fouten vereist geautomatiseerde evaluatiepijplijnen. De meest effectieve methodes omvatten:

- LLM-as-a-Judge: Hierbij wordt een krachtig, gesloten model (zoals GPT-4 of Claude 3.5 Opus) geprompt met een strikte rubric om de output van het doellmodel te beoordelen op accuraatheid.

- Self-Check Methodes: Het LLM wordt gevraagd om meerdere keren hetzelfde antwoord te genereren (hoge temperatuur). Consistentie duidt vaak op hogere betrouwbaarheid, terwijl grote afwijkingen wijzen op potentiële hallucinaties.

- N-LI (Natural Language Inference): Een specifiek classificatiemodel controleert of de hypothese (de gegenereerde claim) direct en logisch voortvloeit uit de premisse (de brontekst).

## Groundedness & Citaties

Bij het bouwen van Retrieval-Augmented Generation (RAG) systemen verschuift de focus van algemene wereldkennis naar groundedness: de mate waarin het antwoord verankerd is in de door u aangeleverde documenten.

Best Practice: Dwing het model om inline citaties te gebruiken naar specifieke alinea's in de bron. Als een bewering in de output geen bijbehorende citatie kan produceren, is de kans op een 'unfaithful' hallucinatie aanzienlijk groter.

## Voorbeeld-testopzet

Een robuuste benchmark voor feitelijkheid zet je als volgt op:

- Dataset creatie: Stel 100 feitelijke vragen samen, gekoppeld aan geverifieerde bronteksten.

- Inference: Laat de te testen LLMs antwoorden genereren puur op basis van de meegeleverde brontekst (temperature = 0).

- Extractie van beweringen: Gebruik een klein model om de output op te breken in atomische claims (bijv. "De maan is grijs", "De maan is gemaakt van kaas").

- Verificatie: Voer een LLM-as-a-Judge pipeline uit via de [API-omgeving](https://api.llmnet.nl/) om per claim te valideren of deze in de brontekst voorkomt.

Heb je vragen over het opzetten van je eigen testpijplijn? Deel je aanpak of vraag om feedback in de [developer community](https://community.llmnet.nl/).

## Evaluatietabel: Benchmark Resultaten

In de onderstaande structuur publiceren we periodiek de scores van verschillende open-source en commerciële modellen op basis van de gestandaardiseerde RAG-factuality benchmark. (Let op: tabel toont momenteel de structuur met placeholders).

Model / Provider | 
Parameters | 
Groundedness (0-100) | 
Factuality Index | 
Hallucination Rate | 

[Model Naam A] | 
[X]B | 
TBD | 
TBD | 
-% | 

[Model Naam B] | 
[X]B | 
TBD | 
TBD | 
-% | 

[Model Naam C] | 
API | 
TBD | 
TBD | 
-% | 

© 2026 llmnet.nl Benchmark. Gebouwd voor veilige AI-implementaties.
