Terug naar Insights
Kennis

Wat is inference bij AI? Uitleg voor het MKB

6 min lezen
Wat is inference bij AI? Uitleg voor het MKB — praktische AI-gids voor Nederlandse MKB-bedrijven

AI-inference is de fase waarin een reeds getraind AI-model wordt toegepast op nieuwe data om direct een voorspelling, antwoord of beslissing te genereren, in tegenstelling tot training waarbij het model zelf leert. Voor MKB-bedrijven is inference het deel van AI waar ze in de praktijk voor betalen en dat de snelheid van hun AI-tools bepaalt, via API-calls en tokengebruik. De keuze tussen realtime en batch inference is vooral een afweging tussen snelheid en kosten.

Inference is de fase waarin een getraind AI-model daadwerkelijk aan het werk gaat: het verwerkt nieuwe input en levert direct een antwoord, voorspelling of beslissing.

Inference is het moment waarop een AI-model dat al getraind is, wordt ingezet op nieuwe, nog niet eerder geziene gegevens om daar direct een antwoord, voorspelling of beslissing uit te halen. Waar training draait om het model iets leren, draait inference om het model dat geleerde toepassen. Elke keer dat je een vraag stelt aan een chatbot, een document laat scannen of een aanbeveling krijgt getoond, is dat inference in actie.

Inference is het model in actie: geen nieuwe kennis, alleen toepassing van wat het al geleerd heeft.

Voor de meeste MKB-ondernemers is inference precies het deel van AI dat ze dagelijks gebruiken en waar ze voor betalen, ook al kennen ze de term niet. Trainen van modellen doen bijna alle bedrijven niet zelf, dat is voorbehouden aan de grote techbedrijven. Inference gebeurt bij elk gebruik van een kant-en-klare AI-tool.

Hoe werkt het

Het verschil tussen training en inference is het beste te begrijpen als twee gescheiden fases in de levenscyclus van een AI-model.

  • Training: het model krijgt enorme hoeveelheden data te zien en leert daaruit patronen. Dit is rekenintensief, kan uren tot weken duren en gebeurt op zware GPU- of TPU-clusters.
  • Inference: het getrainde model verwerkt één nieuwe input tegelijk en levert daar direct een uitkomst voor. Dit is veel lichter dan training, maar moet vaak razendsnel en op grote schaal gebeuren.

Binnen inference gebeurt telkens hetzelfde drietrapsproces:

  1. Input voorbereiden: de nieuwe data (een vraag, foto, document) wordt in het juiste formaat gezet voor het model.
  2. Forward pass: het model analyseert de input met de kennis die het tijdens training heeft opgebouwd. Er wordt niets bijgeleerd, alleen toegepast. Dit heet een forward pass.
  3. Output genereren: het resultaat (een antwoord, score, classificatie) wordt teruggegeven aan de applicatie en aan de gebruiker getoond.

De snelheid waarmee dit gebeurt heet latency, oftewel de wachttijd tussen het versturen van je vraag en het ontvangen van het antwoord. Bij een chatbot wil je latency van hooguit een paar seconden, bij een fraudecontrole in een betaalproces moet het binnen milliseconden gebeuren. Elke inference-aanroep kost ook geld: bij de meeste AI-diensten betaal je per API-call of per verwerkte hoeveelheid tokens (de stukjes tekst waarin het model taal opdeelt). Meer gebruik betekent dus letterlijk meer kosten, ook al is er geen sprake van nieuwe training.

Waarom relevant voor het MKB

Als MKB-ondernemer train je zelf vrijwel nooit een AI-model. Je gebruikt bestaande, kant-en-klare modellen (via een tool, een API of een chatinterface) en betaalt voor de inference die daarbij hoort. Dat betekent dat de kosten en snelheid die je ervaart, niet gaan over hoe slim het model is opgeleid, maar over hoe efficiënt het bij elk gebruik antwoord geeft.

Dit heeft praktische gevolgen:

  • Reactiesnelheid bepaalt gebruikerservaring. Een klantenservice-chatbot die drie seconden nodig heeft voor elk antwoord voelt trager aan dan een concurrent die binnen een seconde reageert.
  • Kosten schalen mee met gebruik. Hoe meer vragen, documenten of klantverzoeken je AI-tool verwerkt, hoe hoger de rekening. Dit is anders dan bij traditionele software, waar de kosten vaak vast zijn.
  • Niet elk proces heeft snelheid nodig. Sommige taken (zoals het nachtelijk categoriseren van facturen) kunnen prima in batch, en dat is vaak goedkoper dan alles realtime te verwerken.

Begrijpen wat inference kost en hoe je dat beheerst, helpt je om AI-tools te kiezen en configureren die passen bij je budget en je verwachtingen over snelheid.

Een concreet voorbeeld

Stel: een MKB-bedrijf zet een AI-chatbot in voor klantenservice op de website. Elke keer dat een bezoeker een vraag typt, gebeurt het volgende:

  1. De vraag (input) wordt naar het taalmodel gestuurd.
  2. Het model doet een forward pass: het herkent de intentie van de vraag op basis van alles wat het tijdens training heeft geleerd over taal en klantvragen.
  3. Het model genereert een antwoord (output) en dat verschijnt binnen enkele seconden in de chat.

Dit hele proces, van vraag tot antwoord, is één inference-aanroep. Bij honderd bezoekers per dag zijn dat honderd (of meer, bij een gesprek met meerdere berichten) losse inference-aanroepen, elk met een eigen latency en kostprijs. Hetzelfde geldt voor een documentscanner die facturen automatisch uitleest: elke pagina die wordt gescand, is een aparte inference-stap waarin het model tekst en bedragen herkent.

Wanneer wel, wanneer niet

Niet elke toepassing heeft realtime inference nodig. De keuze tussen realtime en batch is vooral een kostenafweging.

SituatieAanpakWaarom
Klant wacht direct op antwoord (chat, zoekfunctie)Realtime inferenceLage latency is essentieel voor gebruikerservaring
Nachtelijke verwerking van facturen of documentenBatch inferenceGoedkoper, snelheid is niet urgent
Fraude- of risicodetectie bij transactiesRealtime inferenceBeslissing moet binnen milliseconden vallen
Maandelijkse rapportage of trendanalyseBatch inferenceGrote hoeveelheden data, geen tijdsdruk
Gevoelige data die niet de cloud in magInference op het apparaat zelf (edge)Privacy en lagere bandbreedtekosten

Als vuistregel: kies alleen voor realtime inference waar een gebruiker of proces daadwerkelijk op wacht. Voor achtergrondtaken is batch vaak net zo effectief en aanzienlijk goedkoper.

Verwante begrippen

  • Training: de fase waarin een model leert van data, voorafgaand aan inference.
  • Foundation model: een groot, vooraf getraind model (zoals GPT of Gemini) dat als basis dient voor inference-taken zonder dat je het zelf hoeft te trainen.
  • Latency: de wachttijd tussen een aanvraag en het antwoord van het model.
  • Tokens: de eenheden waarin tekst wordt opgeknipt en verwerkt, de basis voor de meeste prijsmodellen van AI-diensten.
  • API-calls: de technische aanroepen waarmee jouw software een AI-model om een inference vraagt.

Wil je weten hoe inference-kosten en snelheid in jouw bedrijf uitpakken? Een AI-scan laat zien waar AI nu al voor je werkt en waar de kosten van realtime verwerking niet opwegen tegen de baten. Overweeg je een chatbot of automatisering die voortdurend inference draait, zoals een AI-agent voor klantenservice of planning? Dan loont het om vooraf te rekenen aan verwachte volumes. Bij AI-consultancy helpen we MKB-bedrijven om de juiste balans te vinden tussen realtime gemak en beheersbare kosten.

Veelgestelde vragen

Veelgestelde vragen

Korte, heldere antwoorden die je helpen sneller beslissen.

Wat is het verschil tussen training en inference?

Training is de fase waarin een AI-model leert van grote hoeveelheden data, dit is rekenintensief en kan uren tot weken duren. Inference is de fase daarna, waarin het al getrainde model wordt gebruikt om op nieuwe input snel een antwoord of voorspelling te geven. Een MKB-bedrijf heeft vrijwel altijd alleen met inference te maken, niet met training.

Waarom is inference relevant als ik zelf geen AI-modellen bouw?

Elke keer dat je een AI-tool gebruikt, zoals een chatbot of documentscanner, draait er op de achtergrond een inference-aanroep. De snelheid (latency) en kosten die je ervaart als gebruiker zijn direct het resultaat van hoe efficiënt die inference verloopt, ook al train je zelf niets.

Wat kost inference ongeveer?

De meeste AI-diensten rekenen per API-call of per verwerkte hoeveelheid tokens. De exacte prijs verschilt sterk per aanbieder en model, dus vraag bij elke tool na hoe het gebruik wordt afgerekend voordat je opschaalt naar veel gebruikers.

Wanneer kies ik voor batch inference in plaats van realtime?

Kies voor batch inference als niemand direct op het resultaat hoeft te wachten, bijvoorbeeld bij het nachtelijk categoriseren van facturen of een maandelijkse rapportage. Dit is doorgaans goedkoper dan alles realtime te verwerken. Kies voor realtime inference wanneer een klant of proces direct een antwoord nodig heeft, zoals bij een chatbot of fraudedetectie.

Volgende stap

Van inzicht naar implementatie

Dit artikel legt uit hoe het werkt — wij helpen Nederlandse MKB-bedrijven het ook daadwerkelijk te bouwen en te koppelen aan jullie software.

Roadmap in 2 weken · implementatie in 6–8 weken

Aanbevolen voor jou

Gerelateerde artikelen

Doorgaan met lezen: artikelen die inhoudelijk het beste aansluiten op dit onderwerp.

Wat is semantic search? Uitleg voor het MKB - Semantic search is zoeken op betekenis in plaats van exacte woorden, met vector embeddings als motor erachter. Dit artikel legt uit hoe het werkt en wanneer het waarde toevoegt voor het MKB.
21 aug 20266 min
Wat is semantic search? Uitleg voor het MKB
Semantic search is zoeken op betekenis in plaats van exacte woorden, met vector embeddings als motor erachter. Dit artikel legt uit hoe het werkt en wanneer het waarde toevoegt voor het MKB.
Lees meer
Wat is prompt injection? AI-beveiliging uitgelegd - Prompt injection misbruikt AI-taalmodellen door instructies te overschrijven. Lees hoe het werkt en welke risico's het MKB loopt.
19 aug 20264 min
Wat is prompt injection? AI-beveiliging uitgelegd
Prompt injection misbruikt AI-taalmodellen door instructies te overschrijven. Lees hoe het werkt en welke risico's het MKB loopt.
Lees meer
Wat is OCR met AI? Documentherkenning uitgelegd - AI-OCR herkent en structureert tekst uit scans en foto's. Lees hoe het werkt en waar het administratief tijd bespaart.
18 aug 20265 min
Wat is OCR met AI? Documentherkenning uitgelegd
AI-OCR herkent en structureert tekst uit scans en foto's. Lees hoe het werkt en waar het administratief tijd bespaart.
Lees meer
Wat is multimodale AI? Uitleg voor het MKB - Multimodale AI combineert tekst, beeld en spraak tot één samenhangend begrip. Lees hoe het werkt en wanneer het waarde toevoegt voor het MKB.
17 aug 20265 min
Wat is multimodale AI? Uitleg voor het MKB
Multimodale AI combineert tekst, beeld en spraak tot één samenhangend begrip. Lees hoe het werkt en wanneer het waarde toevoegt voor het MKB.
Lees meer
Wat is chain-of-thought redeneren bij AI? - Chain-of-thought redeneren is een techniek waarbij een AI-model een probleem opsplitst in tussenstappen voordat het een antwoord geeft, wat de nauwkeurigheid bij complexe taken verbetert.
16 aug 20265 min
Wat is chain-of-thought redeneren bij AI?
Chain-of-thought redeneren is een techniek waarbij een AI-model een probleem opsplitst in tussenstappen voordat het een antwoord geeft, wat de nauwkeurigheid bij complexe taken verbetert.
Lees meer
Wat is AI-orchestratie? Uitleg voor het MKB - AI-orchestratie is de coördinatielaag die meerdere AI-modellen, agents en tools laat samenwerken in één workflow, in plaats van los van elkaar losse taken uit te voeren.
15 aug 20265 min
Wat is AI-orchestratie? Uitleg voor het MKB
AI-orchestratie is de coördinatielaag die meerdere AI-modellen, agents en tools laat samenwerken in één workflow, in plaats van los van elkaar losse taken uit te voeren.
Lees meer