Doel van deze tool: Vergelijk direct twee promptvarianten en de bijbehorende LLM-outputs. Vul de teksten in, stel per criterium het gewicht en de score (1-5) in, en lees de gewogen einduitslag direct af.
Variant A
Statistieken Output (Schatting):
- Tekens: 0
- Woorden: 0
- Tokens (ruwe schatting): 0
Variant B
Statistieken Output (Schatting):
- Tekens: 0
- Woorden: 0
- Tokens (ruwe schatting): 0
Beoordelingscriteria
Gewogen Eindresultaat
Score Variant A
0.00 / 5
Verschil (Absolute Delta)
0.00
Score Variant B
0.00 / 5
Hoe gebruik je deze tool verstandig?
Het systematisch vergelijken van promptvarianten is essentieel voor het opbouwen van betrouwbare LLM-applicaties. Om te voorkomen dat je beslissingen neemt op basis van toeval of persoonlijke voorkeuren, is een gestructureerde aanpak noodzakelijk. Lees meer over de grondbeginselen in onze handleiding over A/B-testen van prompts.
Houd tijdens het evalueren rekening met de volgende richtlijnen:
- Isoleer variabelen: Pas slechts één onderdeel van de prompt per test aan (bijvoorbeeld het toevoegen van een expliciet format of een rolinstructie). Verander niet de temperatuur of het modeltype tussen twee runs.
- Beperk ankerbias met blind scoren: Gebruik de ingebouwde 'Blinde modus'. Als je weet welke prompt van jou is of welke methode je voorkeur heeft, beoordeel je de output onbewust gekleurd.
- Leg criteria vooraf vast: Bepaal wat belangrijk is voordat je de resultaten leest. Is feitelijke nauwkeurigheid doorslaggevend, of gaat het juist om de schrijfstijl? Ken daar de juiste gewichten aan toe via een vastgesteld kader voor zelf-evaluatie.
- Voer meerdere runs uit: LLM's zijn stochastisch. Een enkele generatie kan geluk of pech hebben. Voor een volwaardige kwaliteitsborging is het verstandig om ook menselijke evaluatie te combineren met grotere testsets.
Wil je sparren over jouw testresultaten of evaluatiemethodieken? Sluit je aan bij de discussie op onze LLMnet Community.


