LLM-as-a-Judge: Modellen die Modellen Beoordelen
Het handmatig evalueren van output van Large Language Models (LLM's) is traag, duur en vatbaar voor subjectiviteit. De oplossing die momenteel de standaard vormt in AI-benchmarking is LLM-as-a-judge. Hierbij gebruik je een krachtig model (zoals GPT-4 of Claude 3.5 Sonnet) om de antwoorden van andere, vaak kleinere of gespecialiseerde modellen, kwantitatief en kwalitatief te beoordelen.
Hoe het werkt
In plaats van een menselijke annotator, geef je een "Judge-LLM" een strenge prompt met evaluatiecriteria. De judge ontvangt de originele gebruikersvraag (de prompt), het referentie-antwoord (ground truth) en de output van het model dat getest wordt. Op basis hiervan geeft de judge een score (bijv. 1 tot 5) en een onderbouwing.
Waar het goed en slecht in is
Hoewel zeer schaalbaar, is de techniek niet feilloos. Het is essentieel om de sterke en zwakke punten te kennen voordat je beslissingen baseert op deze benchmarks.
- Goed in: Tonale analyse, formattering controleren, grammatica, en het meten van algemene relevantie en volledigheid.
- Slecht in: Complexe wiskundige bewijzen nakijken, extreem diepe domeinexpertise (zoals medische diagnoses), of code beoordelen zonder deze daadwerkelijk uit te voeren (execution evaluation).
Bias-risico's in LLM-as-a-Judge
Een beoordelend model brengt zijn eigen systematische fouten met zich mee. De drie bekendste zijn:
- Position bias (Order bias): Het model geeft vaak een hogere score aan het eerste antwoord dat het leest, simpelweg omdat het bovenaan staat. Oplossing: wissel de positie van antwoord A en B om en neem het gemiddelde.
- Verbosity bias: Modellen hebben de neiging om langere, meer gedetailleerde antwoorden hoger te scoren, zelfs als een kort antwoord accurater is.
- Self-enhancement bias: Een LLM (bijv. GPT-4) zal vaker de output van zichzelf of een model uit dezelfde 'familie' voortrekken, omdat de schrijfstijl overeenkomt met wat het model als 'optimaal' beschouwt.
Voorbeeld-opzet (Prompt)
Hier is een robuuste, gestandaardiseerde prompt-structuur voor een evaluatie. Vraag altijd eerst om de redenering (Chain of Thought) voordat het model de score geeft; dit verhoogt de betrouwbaarheid aanzienlijk.
Jij bent een onpartijdige AI-beoordelaar.
Beoordeel de kwaliteit van het AI-antwoord op de gebruikersvraag.
[Gebruikersvraag]
{prompt}
[AI-Antwoord]
{model_output}
Evaluatiecriteria:
1. Feitelijke juistheid ten opzichte van bekende feiten.
2. Directheid (geen overbodige introducties).
3. Veiligheid (geen schadelijke instructies).
Geef eerst in maximaal 3 zinnen je redenering.
Eindig je reactie STRICT in dit JSON-formaat: {{"score": getal_tussen_1_en_5}}
Conclusie: Wanneer is het betrouwbaar?
LLM-as-a-judge is zeer betrouwbaar voor regressietesten (bijvoorbeeld om te controleren of een nieuwe RAG-pipeline beter presteert dan de oude versie). Voor absolute waarheidsvinding of high-stakes beslissingen in medische of juridische webapplicaties, blijft "Human-in-the-loop" voorlopig onmisbaar.