# Prompt A/B-test tool: twee varianten scoren

Deel:[𝕏](https://twitter.com/intent/tweet?url=https%3A//benchmark.llmnet.nl/prompt-ab-test-tool&text=Prompt%20A/B-test%20tool%3A%20twee%20varianten%20scoren)[LinkedIn](https://www.linkedin.com/sharing/share-offsite/?url=https%3A//benchmark.llmnet.nl/prompt-ab-test-tool)[Reddit](https://www.reddit.com/submit?url=https%3A//benchmark.llmnet.nl/prompt-ab-test-tool&title=Prompt%20A/B-test%20tool%3A%20twee%20varianten%20scoren)[Facebook](https://www.facebook.com/sharer/sharer.php?u=https%3A//benchmark.llmnet.nl/prompt-ab-test-tool)[Kopieer link](#)

 
 
# Prompt A/B-test tool

 

 
 Door Ivo Donker — samengesteld met AI-ondersteuning (Claude & Gemini)

 
 Doel van deze tool: Vergelijk direct twee promptvarianten en de bijbehorende LLM-outputs. Vul de teksten in, stel per criterium het gewicht en de score (1-5) in, en lees de gewogen einduitslag direct af.
 

 
 
 
 Blinde modus inschakelen (verbergt 'A' en 'B' om ankerbias te voorkomen)
 
 
 Beoordeling wissen
 Resultaat kopiëren
 
 

 
 
 
 
### Variant A

 
 Prompt A
 
 
 
 Modeloutput A
 
 
 
 Statistieken Output (Schatting):
 
 
- Tekens: 0
 
- Woorden: 0
 
- Tokens (ruwe schatting): 0
 
 
 

 
 
 
### Variant B

 
 Prompt B
 
 
 
 Modeloutput B
 
 
 
 Statistieken Output (Schatting):
 
 
- Tekens: 0
 
- Woorden: 0
 
- Tokens (ruwe schatting): 0
 
 
 
 

 
## Beoordelingscriteria

 

 
 
### Gewogen Eindresultaat

 
 
 Score Variant A
 0.00 / 5
 
 
 Verschil (Absolute Delta)
 0.00
 
 
 Score Variant B
 0.00 / 5
 
 
 Voer beoordelingen in om een uitslag te zien.
 

 
 
## Hoe gebruik je deze tool verstandig?

 
 Het systematisch vergelijken van promptvarianten is essentieel voor het opbouwen van betrouwbare LLM-applicaties. Om te voorkomen dat je beslissingen neemt op basis van toeval of persoonlijke voorkeuren, is een gestructureerde aanpak noodzakelijk. Lees meer over de grondbeginselen in onze handleiding over [A/B-testen van prompts](/ab-testen-prompts).
 

 
 Houd tijdens het evalueren rekening met de volgende richtlijnen:
 

 
 
- Isoleer variabelen: Pas slechts één onderdeel van de prompt per test aan (bijvoorbeeld het toevoegen van een expliciet format of een rolinstructie). Verander niet de temperatuur of het modeltype tussen twee runs.
 
- Beperk ankerbias met blind scoren: Gebruik de ingebouwde 'Blinde modus'. Als je weet welke prompt van jou is of welke methode je voorkeur heeft, beoordeel je de output onbewust gekleurd.
 
- Leg criteria vooraf vast: Bepaal wat belangrijk is voordat je de resultaten leest. Is feitelijke nauwkeurigheid doorslaggevend, of gaat het juist om de schrijfstijl? Ken daar de juiste gewichten aan toe via een vastgesteld [kader voor zelf-evaluatie](/zelf-evalueren-raamwerk).
 
- Voer meerdere runs uit: LLM's zijn stochastisch. Een enkele generatie kan geluk of pech hebben. Voor een volwaardige kwaliteitsborging is het verstandig om ook [menselijke evaluatie](/menselijke-evaluatie) te combineren met grotere testsets.
 
 
 Wil je sparren over jouw testresultaten of evaluatiemethodieken? Sluit je aan bij de discussie op onze [LLMnet Community](https://community.llmnet.nl/).
 

 
 

 Resultaten gekopieerd naar klembord!
