Wat is inference bij AI? Uitleg voor het MKB

AI-inference is de fase waarin een reeds getraind AI-model wordt toegepast op nieuwe data om direct een voorspelling, antwoord of beslissing te genereren, in tegenstelling tot training waarbij het model zelf leert. Voor MKB-bedrijven is inference het deel van AI waar ze in de praktijk voor betalen en dat de snelheid van hun AI-tools bepaalt, via API-calls en tokengebruik. De keuze tussen realtime en batch inference is vooral een afweging tussen snelheid en kosten.
Inference is de fase waarin een getraind AI-model daadwerkelijk aan het werk gaat: het verwerkt nieuwe input en levert direct een antwoord, voorspelling of beslissing.
Inference is het moment waarop een AI-model dat al getraind is, wordt ingezet op nieuwe, nog niet eerder geziene gegevens om daar direct een antwoord, voorspelling of beslissing uit te halen. Waar training draait om het model iets leren, draait inference om het model dat geleerde toepassen. Elke keer dat je een vraag stelt aan een chatbot, een document laat scannen of een aanbeveling krijgt getoond, is dat inference in actie.
Inference is het model in actie: geen nieuwe kennis, alleen toepassing van wat het al geleerd heeft.
Voor de meeste MKB-ondernemers is inference precies het deel van AI dat ze dagelijks gebruiken en waar ze voor betalen, ook al kennen ze de term niet. Trainen van modellen doen bijna alle bedrijven niet zelf, dat is voorbehouden aan de grote techbedrijven. Inference gebeurt bij elk gebruik van een kant-en-klare AI-tool.
Hoe werkt het
Het verschil tussen training en inference is het beste te begrijpen als twee gescheiden fases in de levenscyclus van een AI-model.
- Training: het model krijgt enorme hoeveelheden data te zien en leert daaruit patronen. Dit is rekenintensief, kan uren tot weken duren en gebeurt op zware GPU- of TPU-clusters.
- Inference: het getrainde model verwerkt één nieuwe input tegelijk en levert daar direct een uitkomst voor. Dit is veel lichter dan training, maar moet vaak razendsnel en op grote schaal gebeuren.
Binnen inference gebeurt telkens hetzelfde drietrapsproces:
- Input voorbereiden: de nieuwe data (een vraag, foto, document) wordt in het juiste formaat gezet voor het model.
- Forward pass: het model analyseert de input met de kennis die het tijdens training heeft opgebouwd. Er wordt niets bijgeleerd, alleen toegepast. Dit heet een forward pass.
- Output genereren: het resultaat (een antwoord, score, classificatie) wordt teruggegeven aan de applicatie en aan de gebruiker getoond.
De snelheid waarmee dit gebeurt heet latency, oftewel de wachttijd tussen het versturen van je vraag en het ontvangen van het antwoord. Bij een chatbot wil je latency van hooguit een paar seconden, bij een fraudecontrole in een betaalproces moet het binnen milliseconden gebeuren. Elke inference-aanroep kost ook geld: bij de meeste AI-diensten betaal je per API-call of per verwerkte hoeveelheid tokens (de stukjes tekst waarin het model taal opdeelt). Meer gebruik betekent dus letterlijk meer kosten, ook al is er geen sprake van nieuwe training.
Waarom relevant voor het MKB
Als MKB-ondernemer train je zelf vrijwel nooit een AI-model. Je gebruikt bestaande, kant-en-klare modellen (via een tool, een API of een chatinterface) en betaalt voor de inference die daarbij hoort. Dat betekent dat de kosten en snelheid die je ervaart, niet gaan over hoe slim het model is opgeleid, maar over hoe efficiënt het bij elk gebruik antwoord geeft.
Dit heeft praktische gevolgen:
- Reactiesnelheid bepaalt gebruikerservaring. Een klantenservice-chatbot die drie seconden nodig heeft voor elk antwoord voelt trager aan dan een concurrent die binnen een seconde reageert.
- Kosten schalen mee met gebruik. Hoe meer vragen, documenten of klantverzoeken je AI-tool verwerkt, hoe hoger de rekening. Dit is anders dan bij traditionele software, waar de kosten vaak vast zijn.
- Niet elk proces heeft snelheid nodig. Sommige taken (zoals het nachtelijk categoriseren van facturen) kunnen prima in batch, en dat is vaak goedkoper dan alles realtime te verwerken.
Begrijpen wat inference kost en hoe je dat beheerst, helpt je om AI-tools te kiezen en configureren die passen bij je budget en je verwachtingen over snelheid.
Een concreet voorbeeld
Stel: een MKB-bedrijf zet een AI-chatbot in voor klantenservice op de website. Elke keer dat een bezoeker een vraag typt, gebeurt het volgende:
- De vraag (input) wordt naar het taalmodel gestuurd.
- Het model doet een forward pass: het herkent de intentie van de vraag op basis van alles wat het tijdens training heeft geleerd over taal en klantvragen.
- Het model genereert een antwoord (output) en dat verschijnt binnen enkele seconden in de chat.
Dit hele proces, van vraag tot antwoord, is één inference-aanroep. Bij honderd bezoekers per dag zijn dat honderd (of meer, bij een gesprek met meerdere berichten) losse inference-aanroepen, elk met een eigen latency en kostprijs. Hetzelfde geldt voor een documentscanner die facturen automatisch uitleest: elke pagina die wordt gescand, is een aparte inference-stap waarin het model tekst en bedragen herkent.
Wanneer wel, wanneer niet
Niet elke toepassing heeft realtime inference nodig. De keuze tussen realtime en batch is vooral een kostenafweging.
| Situatie | Aanpak | Waarom |
|---|---|---|
| Klant wacht direct op antwoord (chat, zoekfunctie) | Realtime inference | Lage latency is essentieel voor gebruikerservaring |
| Nachtelijke verwerking van facturen of documenten | Batch inference | Goedkoper, snelheid is niet urgent |
| Fraude- of risicodetectie bij transacties | Realtime inference | Beslissing moet binnen milliseconden vallen |
| Maandelijkse rapportage of trendanalyse | Batch inference | Grote hoeveelheden data, geen tijdsdruk |
| Gevoelige data die niet de cloud in mag | Inference op het apparaat zelf (edge) | Privacy en lagere bandbreedtekosten |
Als vuistregel: kies alleen voor realtime inference waar een gebruiker of proces daadwerkelijk op wacht. Voor achtergrondtaken is batch vaak net zo effectief en aanzienlijk goedkoper.
Verwante begrippen
- Training: de fase waarin een model leert van data, voorafgaand aan inference.
- Foundation model: een groot, vooraf getraind model (zoals GPT of Gemini) dat als basis dient voor inference-taken zonder dat je het zelf hoeft te trainen.
- Latency: de wachttijd tussen een aanvraag en het antwoord van het model.
- Tokens: de eenheden waarin tekst wordt opgeknipt en verwerkt, de basis voor de meeste prijsmodellen van AI-diensten.
- API-calls: de technische aanroepen waarmee jouw software een AI-model om een inference vraagt.
Wil je weten hoe inference-kosten en snelheid in jouw bedrijf uitpakken? Een AI-scan laat zien waar AI nu al voor je werkt en waar de kosten van realtime verwerking niet opwegen tegen de baten. Overweeg je een chatbot of automatisering die voortdurend inference draait, zoals een AI-agent voor klantenservice of planning? Dan loont het om vooraf te rekenen aan verwachte volumes. Bij AI-consultancy helpen we MKB-bedrijven om de juiste balans te vinden tussen realtime gemak en beheersbare kosten.
Veelgestelde vragen
Korte, heldere antwoorden die je helpen sneller beslissen.
Wat is het verschil tussen training en inference?
Training is de fase waarin een AI-model leert van grote hoeveelheden data, dit is rekenintensief en kan uren tot weken duren. Inference is de fase daarna, waarin het al getrainde model wordt gebruikt om op nieuwe input snel een antwoord of voorspelling te geven. Een MKB-bedrijf heeft vrijwel altijd alleen met inference te maken, niet met training.
Waarom is inference relevant als ik zelf geen AI-modellen bouw?
Elke keer dat je een AI-tool gebruikt, zoals een chatbot of documentscanner, draait er op de achtergrond een inference-aanroep. De snelheid (latency) en kosten die je ervaart als gebruiker zijn direct het resultaat van hoe efficiënt die inference verloopt, ook al train je zelf niets.
Wat kost inference ongeveer?
De meeste AI-diensten rekenen per API-call of per verwerkte hoeveelheid tokens. De exacte prijs verschilt sterk per aanbieder en model, dus vraag bij elke tool na hoe het gebruik wordt afgerekend voordat je opschaalt naar veel gebruikers.
Wanneer kies ik voor batch inference in plaats van realtime?
Kies voor batch inference als niemand direct op het resultaat hoeft te wachten, bijvoorbeeld bij het nachtelijk categoriseren van facturen of een maandelijkse rapportage. Dit is doorgaans goedkoper dan alles realtime te verwerken. Kies voor realtime inference wanneer een klant of proces direct een antwoord nodig heeft, zoals bij een chatbot of fraudedetectie.






