# Vertaalkwaliteit van LLM-uitvoer evalueren

Deel:[𝕏](https://twitter.com/intent/tweet?url=https%3A//benchmark.llmnet.nl/vertaalkwaliteit-evalueren-comet-bleurt&text=Vertaalkwaliteit%20van%20LLM-uitvoer%20evalueren)[LinkedIn](https://www.linkedin.com/sharing/share-offsite/?url=https%3A//benchmark.llmnet.nl/vertaalkwaliteit-evalueren-comet-bleurt)[Reddit](https://www.reddit.com/submit?url=https%3A//benchmark.llmnet.nl/vertaalkwaliteit-evalueren-comet-bleurt&title=Vertaalkwaliteit%20van%20LLM-uitvoer%20evalueren)[Facebook](https://www.facebook.com/sharer/sharer.php?u=https%3A//benchmark.llmnet.nl/vertaalkwaliteit-evalueren-comet-bleurt)[Kopieer link](#)

# Vertaalkwaliteit van LLM's Evalueren: COMET, BLEURT & BLEU

Door Ivo Donker — samengesteld met AI-ondersteuning (Claude & Gemini) · Laatst bijgewerkt: 6 augustus 2026

Het kwantificeren van vertaalkwaliteit vormt een van de meest complexe uitdagingen binnen de natuurlijke taalverwerking. Waar bij klassieke classificatietaken of rekenkundige tests sprake is van een eenduidig goed of fout antwoord, kent een vertaling een vrijwel oneindige variatie aan correcte uitkomsten. Met de opkomst van grote taalmodellen (LLM's) als vervanger of aanvulling op traditionele neuraal machinale vertaalsystemen (NMT), is de noodzaak om vertaalkwaliteit nauwkeurig, reproduceerbaar en op schaal te meten alleen maar toegenomen.

In dit artikel ontleden we hoe automatische evaluatiemethoden voor vertaalkwaliteit werken. We behandelen de evolutie van de evaluatietechnologie, analyseren de wiskundige en conceptuele beperkingen van klassieke overlapmaten, en bekijken hoe moderne neurale metrieken zoals COMET en BLEURT het beoordelingslandschap hebben veranderd. Tot slot bespreken we de specifieke valkuilen bij de evaluatie van het Nederlands en bieden we een praktisch kader voor het inrichten van een eigen evaluatie-pijplijn.

## Het fundamentele probleem van vertaalevaluatie

Het meten van vertaalkwaliteit stuit op een taalkundig gegeven: equipollentie of functionele equivalentie. Eén enkele bronzin in een taal zoals het Engels kan op tientallen manieren correct naar het Nederlands worden vertaald. De keuze voor synoniemen, een gewijzigde zinsstructuur, passieve versus actieve vorm of een variatie in woordvolgorde kan tot volstrekt natuurlijke en accurate vertalingen leiden, terwijl de gebruikte lexicale elementen sterk verschillen.

Neem bijvoorbeeld de Engelse bronzin: "The company decided to postpone the product launch due to unexpected software bugs." Mogelijke correcte Nederlandse vertalingen zijn:

 
- "Het bedrijf besloot de productlancering uit te stellen vanwege onverwachte softwarefouten."
 
- "Vanwege onvoorziene fouten in de software heeft de onderneming besloten het op de markt brengen van het product te verschuiven."
 
- "Omwille van onverwachte problemen in de software is de introductie van het product door de organisatie uitgesteld."

Indien een geautomatiseerd evaluatiesysteem de gegenereerde vertaling strikt vergelijkt met slechts één van deze varianten als referentie, worden valide synoniemen ("onderneming" versus "bedrijf") en alternatieve maar grammaticaal correcte constructies afgestraft. Een geautomatiseerde metriek moet dus in staat zijn om semantische gelijkwaardigheid te herkennen los van oppervlakkige woordovereenkomst.

## De drie generaties van evaluatiemethoden

In de ontwikkeling van automatische vertaalevaluatie zijn drie duidelijke generaties te onderscheiden. Elke generatie introduceerde een nieuw paradigma om de afstand tussen machinale beoordeling en menselijke perceptie te verkleinen.

 
 
 Generatie | 
 Methodologie | 
 Voorbeelden | 
 Belangrijkste voordeel | 
 Belangrijkste beperking | 
 

 
 
 
 1. Overlapmaten | 
 Exacte n-gram vergelijking op woord- of karakterniveau | 
 BLEU, ROUGE, METEOR, chrF | 
 Zeer snel, goedkoop, deterministisch | 
 Houdt geen rekening met synoniemen en zinsbouw; afhankelijk van exacte referentie | 
 

 
 2. Aangeleerde neurale maten | 
 Neurale netwerken (BERT-gebaseerd) getraind op menselijke beoordelingen | 
 COMET, BLEURT | 
 Hoge correlatie met menselijke oordelen; begrijpt context en synoniemen | 
 Black-box karakter; vereist GPU-rekenkracht; gevoelig voor specifieke trainingsdata | 
 

 
 3. LLM-beoordeling | 
 Prompting van generatieve taalmodellen met foutenrubrieken | 
 Gemini, GPT-4, Llama 3 met MQM-prompts | 
 Gedetailleerde kwalitatieve feedback en foutanalyse per categorie | 
 Hoge kostprijs per evaluatie; inconsistentie; risico dat model eigen output bevoordeelt | 
 

 

### Eerste generatie: Overlapmaten op woordniveau

De eerste generatie geautomatiseerde metrieken richtte zich op de statistische overeenkomst tussen de gegenereerde vertaling (de hypothese) en een of meer door mensen geschreven referentievertalingen. De bekendste vertegenwoordiger is BLEU (Bilingual Evaluation Understudy), maar ook maten als ROUGE en chrF behoren tot deze categorie.

Deze metrieken tellen het aantal overlappende n-grams (opeenvolgende reksen van n woorden of karakters) tussen hypothese en referentie. Omdat ze uitsluitend kijken naar exacte tekstuele overlap, zien ze semantische verwantschap over het hoofd. Zinnen met exact dezelfde betekenis maar een afwijkende woordkeus krijgen een lage score, terwijl zinnen met veel overlappende woorden maar een foute ontkenning juist hoog kunnen scoren.

### Tweede generatie: Aangeleerde neurale maten

Om de starheid van exacte n-gram overlap te omzeilen, introduceerde de tweede generatie machinaal geleerde evaluatiemodellen. Metrieken zoals BLEURT en COMET maken gebruik van vooraf getrainde meertalige transformermodellen (zoals mBERT of XLM-RoBERTa) die vervolgens zijn gefinetuned op omvangrijke datasets met menselijke kwaliteitsoordelen, zoals de Direct Assessment (DA) of Multidimensional Quality Metrics (MQM) datasets uit de jaarlijkse WMT-evaluatiecompetities.

Deze modellen zetten de brontekst, de hypothese en de referentie om naar dichte vectorrepresentaties (embeddings). Hierdoor evalueren ze niet of de woorden letterlijk overeenkomen, maar of de betekenis en de contextuele gradiënten in de vectorruimte dicht bij elkaar liggen. Dit maakt ze in staat om synoniemen, parafrases en synthetische herstructureringen correct te waarderen.

### Derde generatie: Beoordeling door generatieve taalmodellen

De meest recente ontwikkeling is het inzetten van grote generatieve taalmodellen als evaluator. In plaats van een gecomprimeerd zwevendekommanummer als score te retourneren, leest de LLM-evaluator de brontekst en de vertaling, en past hierop een gestructureerde foutenrubriek toe. Dit stelt de evaluator in staat om niet alleen een kwaliteitsscore te geven, maar ook specifieke segmenten te markeren en te categoriseren (bijvoorbeeld kritieke vertaalfouten, stijlfouten of terminologie-afwijkingen).

## Overlapmaten diepgaand geanalyseerd: BLEU en chrF

Ondanks hun bekende tekortkomingen blijven overlapmaten veelgebruikt in wetenschappelijke literatuur en industriële benchmarkpijplijnen. Het is daarom essentieel om te begrijpen hoe ze werken en waar de grenzen van hun toepasbaarheid liggen.

### Werking en mechaniek van BLEU

BLEU berekent de gewijzigde n-gram precisie voor $n=1$ tot $n=4$. De precisie berekent welk percentage van de n-grams in de hypothese voorkomt in de referentietekst. Om te voorkomen dat een hypothese die simpelweg één correct woord tien keer herhaalt een perfecte score krijgt, gebruikt BLEU 'clipped' precisie: een n-gram kan niet vaker worden meegeteld dan het maximale aantal keren dat het in een enkele referentie voorkomt.

Omdat precisie alleen er toe zou leiden dat een vertaling van slechts twee woorden een score van 100% zou kunnen behalen zolang die twee woorden in de referentie staan, bevat BLEU een lengtestraf (de Brevity Penalty of BP). De uiteindelijke formule luidt:

BLEU = BP × exp( Σn=1..4 wn log pn )

Waarbij pn de n-gram precisie vertegenwoordigt en wn de gewichten (meestal gelijk verdeeld als 0,25). De lengtestraf BP wordt berekend als:

BP = min(1, exp(1 − r / c))

Hierin is c de lengte van de hypothese en r de effectieve referentielengte. Wanneer de gegenereerde zin korter is dan de referentie, wordt de totale score exponentieel verlaagd.

### Waarom BLEU faalt op zinsniveau

BLEU is ontworpen als een metriek op corpusniveau. Wanneer BLEU wordt toegepast op een enkele losse zin (segmentniveau), ontstaat er een wiskundig probleem. Als er voor $n=4$ geen enkele exacte match van vier opeenvolgende woorden tussen de hypothese en de referentie bestaat, wordt p4 = 0. Omdat de formule een geometrisch gemiddelde via logaritmen berekent, wordt de gehele BLEU-score voor die zin daardoor direct nul, ongeacht hoe goed de individuele woorden geselecteerd zijn.

Hoewel er afvlakkingstechnieken (smoothing functions) bestaan om dit probleem te omzeilen, blijft de correlatie tussen BLEU-scores en menselijke oordelen op zinsniveau zeer laag. Daarnaast beloont BLEU systemen die de grammatica van de brontaal te nauwgezet volgen wanneer de referentievertaling eveneens een wat strakke vertaling is, terwijl creatievere maar correcte vertalingen worden afgestraft.

### Het belang van gestandaardiseerde voorbewerking: SacreBLEU

Een historisch probleem met BLEU-scores in de wetenschappelijke literatuur was de gevoeligheid voor de tokenisatie en tekstvoorbewerking. Veranderingen in hoe leestekens worden losgekoppeld, hoe hoofdletters worden behandeld of hoe samengestelde woorden worden gesplitst, kunnen de BLEU-score met meerdere punten doen variëren. Hierdoor waren scores tussen verschillende wetenschappelijke artikelen vaak niet onderling vergelijkbaar.

Om dit op te lossen is SacreBLEU ontwikkeld. SacreBLEU automatiseert het downloaden van standaard testsets en past een gestandaardiseerde, niet-wijzigbare tokenisatie toe. Bij het rapporteren van BLEU-scores is het hanteren van SacreBLEU de norm, waarbij de exacte parameterafbeelding (zoals nrefs:1|case:mixed|eff:no|tok:13a|smooth:exp|version:2.3.1) altijd vermeld dient te worden.

### chrF: Karakterniveau als alternatief

Een sterk alternatief binnen de eerste generatie is chrF (character n-gram F-score). In plaats van woorden vergelijkt chrF n-grams van karakters (meestal $n=6$). Dit biedt grote voordelen voor morfologisch rijke talen en talen met veel samengestelde woorden, zoals het Nederlands en het Duits. Omdat chrF kijkt naar overlappende karakterreeksen, worden kleine variaties in buigingen, vervoegingen en meervoudsvormen niet direct als een volledige fout aangerekend. Uit diverse WMT-evaluaties blijkt dat chrF een significant hogere correlatie vertoont met menselijke oordelen dan BLEU.

## Aangeleerde neurale maten: COMET en BLEURT

Om de beperkingen van n-gram overlap te overkomen, maken moderne evaluatiepijplijnen op grote schaal gebruik van neurale evaluatiemodellen. De twee meest vooraanstaande kaders in dit domein zijn COMET en BLEURT.

### BLEURT: Fine-tuning op synthetische en menselijke data

BLEURT (Bilingual Evaluation Understudy with Representations from Transformers) is ontwikkeld door Google. Het model start met een pre-trained meertalig BERT-model. De cruciale stap in de ontwikkeling van BLEURT is de tussenliggende trainingsfase met synthetische data.

Voordat het model wordt getraind op schaarse menselijke beoordelingen, genereert men miljoenen geperturbeerde zinnen. Dit gebeurt door in bestaande Wikipedia-zinnen woorden te verwijderen, te vervangen door synoniemen, de woordvolgorde te veranderen of machinale vertalingen toe te voegen. Het model leert hierbij te voorspellen welke aanpassingen zijn gedaan en berekent gesimuleerde scores voor onder meer BLEU en BERTscore. Pas na deze fase wordt het model gefinetuned op echte menselijke kwaliteitsbeoordelingen (Direct Assessment scores). Hierdoor kan BLEURT subtiele grammaticaal-semantische afwijkingen uitstekend inschatten.

### COMET: Modelleren met of zonder referentie

COMET (Crosslingual Optimized Metric for Evaluation of Translation), ontwikkeld door Unbabel, gebruikt een architectuur gebaseerd op XLM-RoBERTa. COMET zet de bronzin, de gegenereerde hypothese en de referentievertaling om in vectorrepresentaties. Vervolgens combineert het model deze vectors door middel van element-gewijze absolute verschillen en vermenigvuldigingen, waarna een neuraal netwerk met meerdere lagen (a feed-forward neuraal netwerk) een finale kwaliteitsscore berekent.

Een fundamenteel conceptuele differentiatie binnen COMET is de keuze tussen referentiegebaseerde en referentievrije modellen:

 
- Referentiegebaseerde COMET-modellen (Primary Metrics): Deze modellen nemen drie inputs aan: Bron, Hypothese en Referentie. Ze vergelijken de hypothese zowel met de bron als met de referentie. Dit levert de hoogste correlatie op met menselijke oordelen, maar vereist dat er een kwalitatief hoogwaardige menselijke referentievertaling beschikbaar is.
 
- Referentievrije COMET-modellen (COMET-QE / Quality Estimation): Deze modellen nemen slechts twee inputs aan: de Bron en de Hypothese. Het model beoordeelt de kwaliteit van de vertaling direct op basis van de bronsignalen, zonder dat er een referentievertaling nodig is. Dit maakt COMET-QE uitermate geschikt voor productie-omgevingen waarin real-time kwaliteitscontrole vereist is op gegenereerde vertalingen waarvoor nog geen menselijke referentie bestaat.

Let op: De keuze voor een referentiegebaseerde of referentievrije metriek bepaalt wat je exact meet. Referentiegebaseerde modellen testen of het systeem in staat is een specifieke streefvertaling te benaderen, terwijl referentievrije modellen (QE) primair meten of de vertaling semantisch getrouw is aan de bron en vloeiend leest in de doeltaal, los van specifieke menselijke formuleringen.

## Beoordeling door een taalmodel met een foutgerichte rubriek

De nieuwste ontwikkeling in de evaluatiemethodologie is het inzetten van generatieve LLM's als beoordelaar. Hierbij wordt het taalmodel gevraagd de brontekst en de gegeneerde vertaling te analyseren en fouten te categoriseren volgens een gestructureerd raamwerk, zoals het MQM (Multidimensional Quality Metrics) kader.

In een dergelijke opzet krijgt het evaluatiemodel de opdracht om fouten in te delen in specifieke categorieën, waaronder:

 
- Nauwkeurigheid (Accuracy): Oplossingen zoals weglatingen (omissies), toevoegingen (addities), verkeerde vertalingen (mistranslations) of onvertaalde entiteiten.
 
- Vloeibaarheid (Fluency): Grammaticale fouten, verkeerde spelling, verkeerd leestekenbeheer en onnatuurlijke zinsbouw.
 
- Terminologie & Stijl: Inconsistent gebruik van vakjargon, niet-nageleefde glossaria of een onjuist register.

Aan elke gedetecteerde fout wordt een zwaartegraad gekoppeld (bijvoorbeeld: minor, major, of critical), waarna een formule de uiteindelijke kwaliteitsscore berekent. Dit proces levert uitgebreide diagnostische informatie op die niet te halen is uit een enkel getal van BLEU of COMET. Meer over de opzet van deze beoordelingsvormen is te lezen in ons overzicht van [LLM-as-a-judge methodieken](https://benchmark.llmnet.nl/llm-as-a-judge).

Er kleeft echter een belangrijk methodologisch risico aan deze aanpak: het self-enhancement bias of het 'speler en scheidsrechter'-probleem. Wanneer een specifiek LLM-familieleden (zoals een GPT- of Claude-variant) wordt gebruikt om vertalingen te beoordelen die door hetzelfde of een verwant model zijn gegenereerd, kent het beoordelende model vaak een hogere score toe aan de eigen stijl, zinsconstructies en woordkeuze. Om dit te voorkomen dient het evaluatiemodel strikt gescheiden te worden van het te testen generatiemodel, of moet de evaluatie worden gecross-validated met neutrale neurale metrieken.

## Specifieke uitdagingen bij de evaluatie van het Nederlands

Het evalueren van Nederlandse vertalingen via geautomatiseerde modellen brengt specifieke taalkundige complicaties met zich mee. Algemene metrieken die primair zijn geoptimaliseerd op Engels-centrische data schieten op deze punten regelmatig tekort.

### 1. Aanspreekvormen en register

Het Engels kent geen grammaticaal onderscheid tussen de formele en informele tweede persoon enkelvoud ("you"). In het Nederlands is het verschil tussen "u" en "je/jij" (en de bijbehorende bezittelijke voornaamwoorden "uw" versus "jouw/je") cruciaal voor de toon van een tekst. Een automatische metriek zoals BLEU zal een vertaling met "u" zwaar afstraffen als de referentie "je" gebruikt, hoewel beide grammaticaal correct zijn. Neurale metrieken zoals COMET begrijpen de synchroniciteit beter, maar kunnen inconsistenties binnen één document (het door elkaar halen van u en je) soms over het hoofd zien als de brontaal dit onderscheid niet maakt. Zie voor meer achtergrond over taal-specifieke kenmerken het artikel over [taaldiversiteit in LLM's voor het Nederlands](https://nieuws.llmnet.nl/taaldiversiteit-in-llms-nederlands).

### 2. Samenstellingen en aaneenschrijven

Het Nederlands is een taal die samenstellingen aan elkaar schrijft (bijvoorbeeld "kwaliteitsbeoordelingssysteem"). Veel uit het Engels getransponeerde tokenizers of vertaalmodellen neigen naar Engels ziekte: het onterecht los schrijven van samenstellingen ("kwaliteits beoordelings systeem"). 
Overlapmaten op woordniveau straffen foute samenstellingen vreemd genoeg soms minder zwaar af als de losse woorden overeenkomen met de bron, terwijl het op karakter gebaseerde chrF en getrainde COMET-modellen deze fouten wel correct detecteren en afstraffen.

### 3. Belgisch-Nederlands versus Nederlands-Nederlands

Binnen het Nederlandse taalgebied bestaan duidelijke lexicale en grammaticale verschillen tussen de in Nederland en in Vlaanderen gebruikelijke varianten (bijvoorbeeld "geheel vrijblijvend" versus "reeds", of "magnetron" versus "microgolfoven"). Indien een testset referenties bevat in het Nederlands-Nederlands, zal een model dat uitstekend Belgisch-Nederlands genereert door standaard overlapmaten lager worden gewaardeerd, ondanks een vlekkeloze kwaliteit. Bij het opzetten van tests voor specifieke markten is dit een kritieke variabele; lees hierover ook meer in onze gids over [het testen van Nederlandse taalmodellen](https://benchmark.llmnet.nl/nederlands-testen).

### 4. 'Vertaalklank' en natuurlijk taalgebruik

Een veelvoorkomend fenomeen bij machinale vertalingen en LLM-generaties is het ontstaan van grammaticaal correcte, maar onnatuurlijk klinkende teksten (ook wel translationese of vertaalklank genoemd). Het model volgt de syntactische structuren van de Engelse brontekst te nauwgezet. Neurale metrieken die op menselijke oordelen zijn getraind scoren teksten met vertaalklank vaak verrassend hoog, omdat de semantische lading exact klopt en de zinsbouw niet direct fout is. Pas bij menselijke steekproeven of geavanceerde LLM-rubrieken die specifiek op idiomatische natuurlijkheid toetsen, komen deze tekortkomingen aan het licht.

## Segmentniveau versus corpusniveau

Een cruciaal aspect bij het interpreteren van evaluatiescores is het niveau waarop de aggregatie plaatsvindt. Een veelgemaakte fout in evaluatie-architecturen is het uitsluitend vertrouwen op één geaggregeerde eindscore over de gehele dataset.

Wanneer een testcorpus uit 1.000 zinnen bestaat, kan een model op 990 zinnen een uitstekende vertaling leveren, maar op 10 zinnen een kritieke fout maken (bijvoorbeeld het weglaten van het woord "niet", waardoor de betekenis van de zin exact omdraait). In een geaggregeerde corpusscore voor BLEU of COMET verdwijnen deze 10 kritieke fouten volledig in het gemiddelde. De totaalscore van het model blijft ruim voldoende, terwijl het systeem voor een productie-omgeving onbetrouwbaar is.

Voor een valide evaluatie moeten scores op twee niveaus worden geanalyseerd:

 
- Corpusniveau: Voor het vergelijken van de algemene prestaties van twee modelversies of verschillende systemen.
 
- Segmentniveau: Voor het identificeren van uitschieters (outliers). Door te filteren op zinnen met de laagste individuele COMET- of BLEURT-scores, spoor je direct de kritieke systeemfouten, hallucinaties of uitval van het model op.

## Een werkbare opzet voor een eigen evaluatie-pijplijn

Om binnen een organisatie de vertaalkwaliteit van een LLM of NMT-systeem op een betrouwbare manier te evalueren, is het verstandig om een gestructureerd stappenplan te hanteren. Een robuuste evaluatie vereist geen duizenden zinnen, maar wel een doordachte methodologie.

### Stap 1: Samenstellen van een domeinspecifieke testset

Gebruik geen generieke openbare datasets (zoals Flores of WMT) als primaire maatstaf; LLM's zijn vaak al op deze data getraind (data contamination). Stel een eigen, afgeschermde testset samen van 100 tot 300 segmenten die representatief zijn voor jouw specifieke toepassingsdomein (bijvoorbeeld juridische contracten, technische handleidingen of marketingteksten). Zorg voor hoogwaardige, door professionele menselijke vertalers opgestelde referentievertalingen.

### Stap 2: Implementeer twee onafhankelijke geautomatiseerde maten

Combineer altijd een klassieke of snelle metriek met een geavanceerde neurale metriek. Een bewezen combinatie is:

 
- chrF (via SacreBLEU): Dient als snelle, deterministische nulmeting op karakterniveau om grote afwijkingen en opmaakfouten af te vangen.
 
- COMET (referentiegebaseerd): Dient als de primaire inhoudelijke kwaliteitsindicator voor semantische precisie en vloeiendheid.

### Stap 3: Voer een periodieke menselijke steekproef uit als ijkpunt

Geautomatiseerde metrieken zijn hulpmiddelen, geen absolute waarheid. Neem een willekeurige steekproef van 10 tot 20% van de geëvalueerde segmenten en laat deze beoordelen door een moedertaalspreker of domeinexpert. Laat de beoordelaar cijfers geven of fouten markeren volgens een vereenvoudigde MQM-rubriek. Vergelijk de menselijke oordelen periodiek met de COMET-scores om te verifiëren of de geautomatiseerde metriek nog steeds correleert met de werkelijke kwaliteitsbeleving. Zie voor het opzetten van dergelijke panels onze handleiding over [menselijke evaluatie van taalmodellen](https://benchmark.llmnet.nl/menselijke-evaluatie).

## Wat doe je met de uitkomsten?

Het verzamelen van evaluatiescores is geen doel op zich. De uitkomsten uit de evaluatie-pijplijn sturen de verdere optimalisatie van de taaltaak aan:

### Modelselectie en kostenafweging

Met de kwantitatieve scores kun je onderbouwde keuzes maken over welk model je inzet. Mocht een kleiner, goedkoper open-source model op jouw specifieke testset een COMET-score behalen die nauwelijks afwijkt van een duur, commercieel model, dan kun je met een gerust hart overstappen. Uitgebreide karakteristieken van verschillende modellen vind je in onze kennisbank over [modellen voor vertaaltaken](https://hub.llmnet.nl/modellen-voor-vertalen).

### Prompt-engineering en instructies sturen

Wanneer uit segment-analyses of LLM-foutenrubrieken blijkt dat het model consistent fouten maakt in de Aanspreekvorm (bijvoorbeeld het willekeurig wisselen tussen "u" en "je"), kun je de system prompt gericht aanpassen. Aanpassingen in de prompt kunnen direct opnieuw door de testset gehaald worden om het effect op de score te meten. Meer technieken voor meertalige instructies zijn te vinden in het overzicht over [meertalige prompt-strategieën](https://community.llmnet.nl/meertalige-prompts).

### Opbouwen van een dynamische terminologielijst (Glossary)

Indien de evaluatie uitwijst dat specifieke vakjargon-termen verkeerd of inconsistent worden vertaald, biedt het toevoegen van een vast naslagbestand of glossarium uitkomst. Door specifieke voorkeursvertalingen via in-context learning of een glossary-pijplijn aan het model mee te geven, worden vakterm-fouten direct geëlimineerd zonder dat het gehele model opnieuw getraind hoeft te worden.

## Lees ook

 
- [Het testen en evalueren van Nederlandse taalmodellen](https://benchmark.llmnet.nl/nederlands-testen)
 
- [LLM-as-a-judge: Kwaliteitscontrole met taalmodellen](https://benchmark.llmnet.nl/llm-as-a-judge)
 
- [Menselijke evaluatiemethoden en mens-in-the-loop benchmarks](https://benchmark.llmnet.nl/menselijke-evaluatie)
 
- [Overzicht van geschikte modellen voor vertaaltaken](https://hub.llmnet.nl/modellen-voor-vertalen)
 
- [Optimale meertalige prompts schrijven voor LLM's](https://community.llmnet.nl/meertalige-prompts)
 
- [Taaldiversiteit en de positie van het Nederlands in LLM's](https://nieuws.llmnet.nl/taaldiversiteit-in-llms-nederlands)

llmnet.nl - benchmarks en evaluatie van taalmodellen
