Hallucinaties meten: hoe test je de feitelijkheid van een LLM?

Een gids voor ontwikkelaars en data-engineers over het kwantificeren van model-betrouwbaarheid.

Wat is een hallucinatie in een LLM?

Een hallucinatie treedt op wanneer een Large Language Model (LLM) tekst genereert die syntactisch en semantisch aannemelijk klinkt, maar feitelijk onjuist is of niet logisch voortvloeit uit de meegegeven context. In de context van bedrijfsapplicaties vormen hallucinaties het grootste obstakel voor veilige en betrouwbare inzetbaarheid.

Meetmethodes op hoofdlijnen

Het structureel meten van deze fouten vereist geautomatiseerde evaluatiepijplijnen. De meest effectieve methodes omvatten:

Groundedness & Citaties

Bij het bouwen van Retrieval-Augmented Generation (RAG) systemen verschuift de focus van algemene wereldkennis naar groundedness: de mate waarin het antwoord verankerd is in de door u aangeleverde documenten.

Best Practice: Dwing het model om inline citaties te gebruiken naar specifieke alinea's in de bron. Als een bewering in de output geen bijbehorende citatie kan produceren, is de kans op een 'unfaithful' hallucinatie aanzienlijk groter.

Voorbeeld-testopzet

Een robuuste benchmark voor feitelijkheid zet je als volgt op:

  1. Dataset creatie: Stel 100 feitelijke vragen samen, gekoppeld aan geverifieerde bronteksten.
  2. Inference: Laat de te testen LLMs antwoorden genereren puur op basis van de meegeleverde brontekst (temperature = 0).
  3. Extractie van beweringen: Gebruik een klein model om de output op te breken in atomische claims (bijv. "De maan is grijs", "De maan is gemaakt van kaas").
  4. Verificatie: Voer een LLM-as-a-Judge pipeline uit via de API-omgeving om per claim te valideren of deze in de brontekst voorkomt.

Heb je vragen over het opzetten van je eigen testpijplijn? Deel je aanpak of vraag om feedback in onze developer community.

Evaluatietabel: Benchmark Resultaten

In de onderstaande structuur publiceren we periodiek de scores van verschillende open-source en commerciƫle modellen op basis van onze gestandaardiseerde RAG-factuality benchmark. (Let op: tabel toont momenteel de structuur met placeholders).

Model / Provider Parameters Groundedness (0-100) Factuality Index Hallucination Rate
[Model Naam A] [X]B TBD TBD -%
[Model Naam B] [X]B TBD TBD -%
[Model Naam C] API TBD TBD -%