# Latency, doorvoer en tokens/seconde

[Naar de inhoud](#lm-inhoud)Netwerk/NL[EN](/en/snelheid-meten)[Hubhub.llmnet.nlModellen vergelijken op taak, taal, kosten en licentie.](https://hub.llmnet.nl/)[Communitycommunity.llmnet.nlPrompttechnieken, patronen en systeemprompts.](https://community.llmnet.nl/)[APIapi.llmnet.nlLLM's robuust in software: rate limits, routing, structured output.](https://api.llmnet.nl/)[Consultancyconsultancy.llmnet.nlAI invoeren in een organisatie, van pilot tot productie.](https://consultancy.llmnet.nl/)[Nieuwsnieuws.llmnet.nlOntwikkelingen in AI, geduid voor Nederland.](https://nieuws.llmnet.nl/)[Benchmarkbenchmark.llmnet.nlZelf meten wat AI-kwaliteit is, voor jouw taken.](https://benchmark.llmnet.nl/)[Vacaturesvacatures.llmnet.nlAI-rollen, salarissen en carrièrepaden in Nederland.](https://vacatures.llmnet.nl/)[Lerenleren.llmnet.nlAI-concepten in gewoon Nederlands, van beginner tot bouwer.](https://leren.llmnet.nl/)[Gidsgids.llmnet.nlAI privé draaien op eigen Mac, pc, NAS of thuisserver.](https://gids.llmnet.nl/)[Directorydirectory.llmnet.nlHet AI-ecosysteem in kaart: tools, modellen, bedrijven.](https://directory.llmnet.nl/)[Radarradar.llmnet.nlSignalen uit X, onderzoek en communities voor indie developers.](https://radar.llmnet.nl/)[Appsapps.llmnet.nlReviews van AI-apps en open-source repo's, met tips voor wie zelf bouwt.](https://apps.llmnet.nl/)[llmnet.nl — hoofdsite](https://llmnet.nl/)[](https://x.com/intent/post?url=https%3A%2F%2Fbenchmark.llmnet.nl%2Fsnelheid-meten&text=Latency%2C%20doorvoer%20en%20tokens%2Fseconde)[](https://www.linkedin.com/sharing/share-offsite/?url=https%3A%2F%2Fbenchmark.llmnet.nl%2Fsnelheid-meten)[](https://www.reddit.com/submit?url=https%3A%2F%2Fbenchmark.llmnet.nl%2Fsnelheid-meten&title=Latency%2C%20doorvoer%20en%20tokens%2Fseconde)[](#)[](https://x.com/intent/post?url=https%3A%2F%2Fbenchmark.llmnet.nl%2Fsnelheid-meten&text=Latency%2C%20doorvoer%20en%20tokens%2Fseconde)[](https://www.linkedin.com/sharing/share-offsite/?url=https%3A%2F%2Fbenchmark.llmnet.nl%2Fsnelheid-meten)[](https://www.reddit.com/submit?url=https%3A%2F%2Fbenchmark.llmnet.nl%2Fsnelheid-meten&title=Latency%2C%20doorvoer%20en%20tokens%2Fseconde)[](#)Door Ivo Donker — samengesteld met AI-ondersteuning (Claude & Gemini) · Laatst bijgewerkt: 27 juli 2026

# Latency, doorvoer en tokens/seconde

Hoe meet je de werkelijke prestaties van Large Language Models op een objectieve en reproduceerbare manier?

## Inleiding

Het meten van de snelheid van Large Language Models (LLM's) verschilt fundamenteel van traditionele webapplicaties. Waar een webserver in milliseconden een volledig HTTP-antwoord retourneert, genereren LLM's tekst token voor token in een iteratief proces. Dit vraagt om gespecialiseerde metrieken en een zorgvuldige meetopzet om appels met peren te vergelijken.

## De Kernmetrieken

Om de prestaties van een LLM-endpoint accuraat in kaart te brengen, wordt gekeken naar drie fundamentele pijlers:

TTFT (Time to First Token)
De tijd vanaf het verzenden van de prompt tot het ontvangen van het allereerste gegenereerde token. Dit bepaalt hoe 'responsief' een applicatie aanvoelt voor de eindgebruiker.

Tokens per Seconde (Generatie)
De snelheid waarmee de autoregressieve loop na het eerste token nieuwe tokens produceert. Dit beidt inzicht in de rekenkracht van de onderliggende inferentie-hardware.

Totale Doorvoer (Throughput)
De totale verwerkte workload over tijd, uitgedrukt in totale tokens (input + output) gedeeld door de totale verwerkingstijd inclusief netwerklatency.

## Wat beïnvloedt de snelheid?

Verschillende factoren op hardware-, model- en netwerkniveau oefenen direct invloed uit op de gemeten prestaties:

- Hardware en Kwantisering: VRAM-bandbreedte (bijv. HBM3e vs. GDDR6) is vaak de voornaamste bottleneck. Kwantisering (zoals INT4 of FP8) verlaagt het geheugenbeslag en verhoogt de tokens/seconde, mits de hardware er voor geoptimaliseerd is.

- Prompt Lengte (Context Window): De prefill-fase (het verwerken van de inputprompt) schaalt anders dan de generatiefase. Langere ingangen verhogen de TTFT aanzienlijk.

- Concurrency en Batching: Dynamische batching op de inferentie-engine (zoals vLLM of TGI) maximaliseert de GPU-benutting onder zware belasting, wat invloed heeft op individuele latency.

- Netwerklatency: Fysieke afstand tot het datacenter en de implementatie van server-sent events (SSE) of WebSockets beïnvloeden de waargenomen responstijd.

## Voorbeeld-meetopzet

Voor een eerlijke en reproduceerbare benchmark is het noodzakelijk om externe variabelen te controleren. Hieronder staat een conceptueel script om gestandaardiseerde metingen uit te voeren via een API.

import time
import requests

def benchmark_endpoint(api_url, payload, api_key, iterations=5):
headers = {"Authorization": f"Bearer {api_key}", "Content-Type": "application/json"}
results = []

for i in range(iterations):
start_time = time.perf_counter()
first_token_time = None
total_tokens = 0

response = requests.post(api_url, json=payload, headers=headers, stream=True)

for line in response.iter_lines():
if line:
if first_token_time is None:
first_token_time = time.perf_counter()
# Tel tokens op basis van chunk structuur (provider-specifiek)
total_tokens += 1

end_time = time.perf_counter()

ttft = first_token_time - start_time
total_duration = end_time - start_time
generation_time = total_duration - ttft
tokens_per_sec = total_tokens / generation_time if generation_time > 0 else 0

results.append({
"run": i + 1,
"ttft_sec": ttft,
"tokens_per_sec": tokens_per_sec
})

return results

## Vergelijkende Tabel

In onderstaande tabel worden metingen gestructureerd vastgelegd. Let op: de getoonde waarden zijn placeholders en dienen te worden ingevuld aan de hand van werkelijke, gekalibreerde testruns.

Model & Configuratie | 
Input Tokens | 
Output Tokens | 
Gem. TTFT (s) | 
Generatie (tok/s) | 

[Model A - 8B - FP16] | 
[Placeholder] | 
[Placeholder] | 
[Placeholder] | 
[Placeholder] | 

[Model B - 70B - INT4] | 
[Placeholder] | 
[Placeholder] | 
[Placeholder] | 
[Placeholder] | 

[Model C - Serverless API] | 
[Placeholder] | 
[Placeholder] | 
[Placeholder] | 
[Placeholder] | 

[← Terug naar API Documentatie](https://api.llmnet.nl/)
[Verken de Model Hub →](https://hub.llmnet.nl/)

© 2026 LLMnet.nl Benchmark. Alle rechten voorbehouden.
