# Prompt A/B-test tool: twee varianten scoren

[Naar de inhoud](#lm-inhoud)Netwerk/NL[EN](/en/prompt-ab-test-tool)[Hubhub.llmnet.nlModellen vergelijken op taak, taal, kosten en licentie.](https://hub.llmnet.nl/)[Communitycommunity.llmnet.nlPrompttechnieken, patronen en systeemprompts.](https://community.llmnet.nl/)[APIapi.llmnet.nlLLM's robuust in software: rate limits, routing, structured output.](https://api.llmnet.nl/)[Consultancyconsultancy.llmnet.nlAI invoeren in een organisatie, van pilot tot productie.](https://consultancy.llmnet.nl/)[Nieuwsnieuws.llmnet.nlOntwikkelingen in AI, geduid voor Nederland.](https://nieuws.llmnet.nl/)[Benchmarkbenchmark.llmnet.nlZelf meten wat AI-kwaliteit is, voor jouw taken.](https://benchmark.llmnet.nl/)[Vacaturesvacatures.llmnet.nlAI-rollen, salarissen en carrièrepaden in Nederland.](https://vacatures.llmnet.nl/)[Lerenleren.llmnet.nlAI-concepten in gewoon Nederlands, van beginner tot bouwer.](https://leren.llmnet.nl/)[Gidsgids.llmnet.nlAI privé draaien op eigen Mac, pc, NAS of thuisserver.](https://gids.llmnet.nl/)[Directorydirectory.llmnet.nlHet AI-ecosysteem in kaart: tools, modellen, bedrijven.](https://directory.llmnet.nl/)[Radarradar.llmnet.nlSignalen uit X, onderzoek en communities voor indie developers.](https://radar.llmnet.nl/)[Appsapps.llmnet.nlReviews van AI-apps en open-source repo's, met tips voor wie zelf bouwt.](https://apps.llmnet.nl/)[llmnet.nl — hoofdsite](https://llmnet.nl/)[](https://x.com/intent/post?url=https%3A%2F%2Fbenchmark.llmnet.nl%2Fprompt-ab-test-tool&text=Prompt%20A%2FB-test%20tool%3A%20twee%20varianten%20scoren)[](https://www.linkedin.com/sharing/share-offsite/?url=https%3A%2F%2Fbenchmark.llmnet.nl%2Fprompt-ab-test-tool)[](https://www.reddit.com/submit?url=https%3A%2F%2Fbenchmark.llmnet.nl%2Fprompt-ab-test-tool&title=Prompt%20A%2FB-test%20tool%3A%20twee%20varianten%20scoren)[](#)[](https://x.com/intent/post?url=https%3A%2F%2Fbenchmark.llmnet.nl%2Fprompt-ab-test-tool&text=Prompt%20A%2FB-test%20tool%3A%20twee%20varianten%20scoren)[](https://www.linkedin.com/sharing/share-offsite/?url=https%3A%2F%2Fbenchmark.llmnet.nl%2Fprompt-ab-test-tool)[](https://www.reddit.com/submit?url=https%3A%2F%2Fbenchmark.llmnet.nl%2Fprompt-ab-test-tool&title=Prompt%20A%2FB-test%20tool%3A%20twee%20varianten%20scoren)[](#)

 
 
# Prompt A/B-test tool

 

 
 Door Ivo Donker — samengesteld met AI-ondersteuning (Claude & Gemini)

 
 Doel van deze tool: Vergelijk direct twee promptvarianten en de bijbehorende LLM-outputs. Vul de teksten in, stel per criterium het gewicht en de score (1-5) in, en lees de gewogen einduitslag direct af.
 

 
 
 
 Blinde modus inschakelen (verbergt 'A' en 'B' om ankerbias te voorkomen)
 
 
 Beoordeling wissen
 Resultaat kopiëren
 
 

 
 
 
 
### Variant A

 
 Prompt A
 
 
 
 Modeloutput A
 
 
 
 Statistieken Output (Schatting):
 
 
- Tekens: 0
 
- Woorden: 0
 
- Tokens (ruwe schatting): 0
 
 
 

 
 
 
### Variant B

 
 Prompt B
 
 
 
 Modeloutput B
 
 
 
 Statistieken Output (Schatting):
 
 
- Tekens: 0
 
- Woorden: 0
 
- Tokens (ruwe schatting): 0
 
 
 
 

 
## Beoordelingscriteria

 

 
 
### Gewogen Eindresultaat

 
 
 Score Variant A
 0.00 / 5
 
 
 Verschil (Absolute Delta)
 0.00
 
 
 Score Variant B
 0.00 / 5
 
 
 Voer beoordelingen in om een uitslag te zien.
 

 
 
## Hoe gebruik je deze tool verstandig?

 
 Het systematisch vergelijken van promptvarianten is essentieel voor het opbouwen van betrouwbare LLM-applicaties. Om te voorkomen dat je beslissingen neemt op basis van toeval of persoonlijke voorkeuren, is een gestructureerde aanpak noodzakelijk. Lees meer over de grondbeginselen in de handleiding over [A/B-testen van prompts](/ab-testen-prompts).
 

 
 Houd tijdens het evalueren rekening met de volgende richtlijnen:
 

 
 
- Isoleer variabelen: Pas slechts één onderdeel van de prompt per test aan (bijvoorbeeld het toevoegen van een expliciet format of een rolinstructie). Verander niet de temperatuur of het modeltype tussen twee runs.
 
- Beperk ankerbias met blind scoren: Gebruik de ingebouwde 'Blinde modus'. Als je weet welke prompt van jou is of welke methode je voorkeur heeft, beoordeel je de output onbewust gekleurd.
 
- Leg criteria vooraf vast: Bepaal wat belangrijk is voordat je de resultaten leest. Is feitelijke nauwkeurigheid doorslaggevend, of gaat het juist om de schrijfstijl? Ken daar de juiste gewichten aan toe via een vastgesteld [kader voor zelf-evaluatie](/zelf-evalueren-raamwerk).
 
- Voer meerdere runs uit: LLM's zijn stochastisch. Een enkele generatie kan geluk of pech hebben. Voor een volwaardige kwaliteitsborging is het verstandig om ook [menselijke evaluatie](/menselijke-evaluatie) te combineren met grotere testsets.
 
 
 Wil je sparren over jouw testresultaten of evaluatiemethodieken? Sluit je aan bij de discussie op de [LLMnet Community](https://community.llmnet.nl/).
 

 
 

 Resultaten gekopieerd naar klembord!
