Hallucinaties meten: hoe test je de feitelijkheid van een LLM?
Een gids voor ontwikkelaars en data-engineers over het kwantificeren van model-betrouwbaarheid.
Wat is een hallucinatie in een LLM?
Een hallucinatie treedt op wanneer een Large Language Model (LLM) tekst genereert die syntactisch en semantisch aannemelijk klinkt, maar feitelijk onjuist is of niet logisch voortvloeit uit de meegegeven context. In de context van bedrijfsapplicaties vormen hallucinaties het grootste obstakel voor veilige en betrouwbare inzetbaarheid.
Meetmethodes op hoofdlijnen
Het structureel meten van deze fouten vereist geautomatiseerde evaluatiepijplijnen. De meest effectieve methodes omvatten:
- LLM-as-a-Judge: Hierbij wordt een krachtig, gesloten model (zoals GPT-4 of Claude 3.5 Opus) geprompt met een strikte rubric om de output van het doellmodel te beoordelen op accuraatheid.
- Self-Check Methodes: Het LLM wordt gevraagd om meerdere keren hetzelfde antwoord te genereren (hoge temperatuur). Consistentie duidt vaak op hogere betrouwbaarheid, terwijl grote afwijkingen wijzen op potentiƫle hallucinaties.
- N-LI (Natural Language Inference): Een specifiek classificatiemodel controleert of de hypothese (de gegenereerde claim) direct en logisch voortvloeit uit de premisse (de brontekst).
Groundedness & Citaties
Bij het bouwen van Retrieval-Augmented Generation (RAG) systemen verschuift de focus van algemene wereldkennis naar groundedness: de mate waarin het antwoord verankerd is in de door u aangeleverde documenten.
Voorbeeld-testopzet
Een robuuste benchmark voor feitelijkheid zet je als volgt op:
- Dataset creatie: Stel 100 feitelijke vragen samen, gekoppeld aan geverifieerde bronteksten.
- Inference: Laat de te testen LLMs antwoorden genereren puur op basis van de meegeleverde brontekst (temperature = 0).
- Extractie van beweringen: Gebruik een klein model om de output op te breken in atomische claims (bijv. "De maan is grijs", "De maan is gemaakt van kaas").
- Verificatie: Voer een LLM-as-a-Judge pipeline uit via de API-omgeving om per claim te valideren of deze in de brontekst voorkomt.
Heb je vragen over het opzetten van je eigen testpijplijn? Deel je aanpak of vraag om feedback in onze developer community.
Evaluatietabel: Benchmark Resultaten
In de onderstaande structuur publiceren we periodiek de scores van verschillende open-source en commerciƫle modellen op basis van onze gestandaardiseerde RAG-factuality benchmark. (Let op: tabel toont momenteel de structuur met placeholders).
| Model / Provider | Parameters | Groundedness (0-100) | Factuality Index | Hallucination Rate |
|---|---|---|---|---|
| [Model Naam A] | [X]B | TBD | TBD | -% |
| [Model Naam B] | [X]B | TBD | TBD | -% |
| [Model Naam C] | API | TBD | TBD | -% |