De afgelopen twee jaar was de centrale vraag op het gebied van AI eenvoudig: Welk model is het slimste? Die vraag wordt steeds minder doorslaggevend. De modellaag wordt sneller dan verwacht een standaardproduct, waarbij prestatiekloven die vroeger een jaar in beslag namen, nu binnen een kwartaal worden gedicht – vaak dankzij technische vooruitgang buiten het model zelf. Er komt daarom een nieuwe variabele bij in de AI-beslissingsmatrix: Hoeveel kost een muntje?
Het token is inmiddels veel verder geëvolueerd dan de technische definitie ervan als een eenheid die kleiner is dan een woord.
- Aan een agent, een token is de basiseenheid van werk.
- Aan een CFO, een token vormt een opkomende bedrijfskost.
- Naar de markt, waarbij een token zich in toenemende mate gedraagt als een verhandelbaar product, met verschillende aanbieders, prijzen, routeringsmechanismen en zelfs opkomende financiële instrumenten.
Onze centrale stelling is eenvoudig: De tokeneconomie is in wezen een energie-economie die in software is verpakt. Naarmate de mogelijkheden van modellen steeds meer op elkaar gaan lijken, zal het vermogen om betrouwbare tokens te genereren en te distribueren tegen lagere en beter voorspelbare kosten een steeds belangrijkere bron van concurrentievoordeel worden.
Agenten hebben de economische aspecten van AI ingrijpend veranderd
Traditionele chatinterfaces zorgden voor een natuurlijke beperking van het gebruik van AI: mensen zijn traag. Een gebruiker stelt een vraag, wacht op een antwoord, leest dit en formuleert de volgende vraag. Menselijke interactie is daarom fungeert als een rem op het verbruik van tokens.
De agenten halen die gashendel weg. Een programmeeragent kan een taak plannen, bestanden controleren, hulpprogramma’s aanroepen, opdrachten uitvoeren, resultaten evalueren, fouten corrigeren en het proces herhalen. Elke iteratie kan de context die aan het model wordt teruggekoppeld, uitbreiden. Volgens schattingen uit de sector worden de werkbelastingen van agenten doorgaans geraamd op 10–50 keer zoveel tokenverbruik als bij traditionele interacties met één beurt, afhankelijk van de taak.
Dit verandert de economische aspecten van AI. Naarmate het gebruik van agents toeneemt, wordt het verbruik van tokens steeds minder afhankelijk van menselijk gebruik en steeds meer afhankelijk van machine-uitvoering. De markt reageert nu al: door het intensieve gebruik zijn AI-producten zoals Cursor en Claude Code gedwongen hun vaste abonnementsmodellen te herzien, het invoeren van gebruikslimieten of extra kosten wanneer een klein aantal gebruikers onevenredig grote hoeveelheden rekenkracht verbruikt.
Het logische antwoord is multimodale routebepaling. Niet elke stap in de workflow van een agent vereist een geavanceerd model. Complexe planning kan worden toevertrouwd aan een hoogwaardig model, terwijl het ophalen van informatie, het samenvatten, het classificeren of het uitvoeren van routinematige taken kan worden afgehandeld door kleinere, goedkopere modellen. Onderzoeksframeworks zoals RouteLLM en FrugalGPT hebben aangetoond dat er zijn aanzienlijke kostenbesparingen mogelijk zonder dat dit ten koste gaat van de prestaties.
Dit is waar de agent-harnas wordt van strategisch belang. Het ‘harness’ – de laag die verantwoordelijk is voor planning, het coördineren van tools, contextbeheer, foutherstel en integraties – kan zwakke punten in het onderliggende model compenseren.
Door betere techniek kan de praktische kloof tussen dure geavanceerde modellen en goedkopere alternatieven dus worden verkleind.
De implicatie is aanzienlijk: de intelligentiepremie van het model neemt af, terwijl de economische aspecten van de inferentie steeds belangrijker worden.
Caching maakt de fysieke kosten van een token zichtbaar
Routing vormt slechts één aspect van de optimalisatie van tokens. Caching van prompts heeft als nadeel: overbodige berekeningen.
Agent-workflows verzenden herhaaldelijk dezelfde systeemprompts, tooldefinities en permanente context. In plaats van deze tokens telkens opnieuw te berekenen, kunnen providers de onderliggende KV-toestanden in de cache opslaan en deze hergebruiken.
Grote aanbieders bieden tegenwoordig aanzienlijke kortingen voor in de cache opgeslagen invoer, in sommige gevallen nadert 90%. De exacte prijsstelling verschilt per model en cacheduur, maar het economische principe blijft hetzelfde: als de berekening al is uitgevoerd, kost hergebruik daarna aanzienlijk minder.
Dit onderscheid is van belang omdat een De cachekorting van de 90% is niet hetzelfde als het cache-hitpercentage van de 90%. Indien er 90% aan tokens in de cache zijn opgeslagen en de tokens in de cache slechts 10% van de catalogusprijs kosten, bedragen de gemiddelde kosten ongeveer 19% van de oorspronkelijke prijs: een effectieve besparing van ongeveer 80%.
Voor de financiële planning van ondernemingen zijn deze verschillen van belang. Bij tokeneconomie gaat het niet louter om de catalogusprijs; het gaat om de effectieve kosten per eenheid bij reële werklasten.
Caching brengt ook iets diepers aan het licht. Waarom is een in de cache opgeslagen token goedkoper? Omdat er minder rekenkracht nodig is. Minder rekenkracht betekent minder GPU-cycli. GPU-cycli verbruiken elektriciteit. Met andere woorden, de prijs van een token weerspiegelt uiteindelijk de fysieke infrastructuur.
Een token is gekristalliseerde elektriciteit
Op infrastructuurniveau omvat de prijs van een token de kosten van GPU’s en de afschrijving daarvan, de capaciteit van het data-centrum, netwerkvoorzieningen, koeling en, bovenal, elektriciteit.
De precieze kostenverdeling varieert per architectuur en boekhoudkundige methode, maar de tendens is duidelijk: naarmate AI-inferentie op grotere schaal plaatsvindt, Energie wordt een van de belangrijkste beperkende factoren voor de economische aspecten van kunstmatige intelligentie.
De cijfers zijn nu al aanzienlijk. Een typische AI-interactie verbruikt misschien slechts een fractie van een wattuur, maar wanneer dit wordt vermenigvuldigd met honderden miljarden interacties en versterkt door agentgebaseerde workflows waarbij herhaaldelijk wordt geredeneerd en gebruik wordt gemaakt van tools, wordt de totale energiebehoefte enorm.
Het Internationaal Energieagentschap verwacht dat het wereldwijde elektriciteitsverbruik datacenter bijna 950 TWh tegen 2030, wat neerkomt op een bijna verdubbeling ten opzichte van het niveau van 2025.
Geografie speelt dan ook een belangrijke rol. De elektriciteitsprijzen voor de industrie lopen sterk uiteen tussen de belangrijkste AI-markten, terwijl China de opwekking van hernieuwbare energie in een buitengewoon tempo heeft uitgebreid en via zijn “East Data, West Computing”-strategie fors heeft geïnvesteerd in de westelijke regio’s, waar een overvloed aan energie beschikbaar is.
Software-intelligentie kan binnen enkele maanden wereldwijd worden opgeschaald, maar goedkope, betrouwbare elektriciteit Dat is niet mogelijk. Het opbouwen van opwekkingscapaciteit, transmissie-infrastructuur en data-centra vereist jarenlange kapitaalinvesteringen. Naarmate de mogelijkheden van modellen steeds beter onderling inwisselbaar worden, wordt toegang tot overvloedige en goedkope rekenkracht een steeds duurzamer voordeel.
Tokens zetten energie om in een wereldwijd verhandelbare dienst
Elektriciteit zelf is moeilijk over de grenzen heen te exporteren. Elektriciteitsnetten blijven in wezen regionaal van aard. Tokens bieden een oplossing voor dit probleem.
Binnen in een data-centrum, elektriciteit wordt rekenkracht. Rekenkracht wordt omgezet in tokens. Tokens kunnen vervolgens onmiddellijk via API’s en glasvezelnetwerken worden verzonden naar gebruikers overal ter wereld. Het token is derhalve een vorm van gedigitaliseerde energie: fysieke energie die wordt omgezet in een wereldwijd leverbare dienst.
Dit helpt de toenemende concurrentiekracht van Chinese AI-modellen te verklaren. Volgens schattingen uit de sector kunnen de inferentiekosten voor toonaangevende Chinese modellen aanzienlijk lager liggen dan die van westerse tegenhangers, hoewel het exacte verschil varieert per model, aanbieder en werklast.
De reactie van de markt wordt steeds duidelijker zichtbaar. Met OpenRouter en andere routeringsplatforms kunnen ontwikkelaars modellen vergelijken op het gebied van prijs, latentie en prestaties, en het verkeer dynamisch omleiden. Chinese modellen hebben een aanzienlijk aandeel in het gerouteerde verkeer veroverd, terwijl modellen met open weging, zoals Qwen en DeepSeek, een steeds prominentere rol spelen in wereldwijde ecosystemen voor ontwikkelaars.
Dit betekent niet dat westerse grensverleggende modellen aan relevantie inboeten. Premiummodellen behouden hun prijszettingsvermogen voor complexe redeneringen waarbij veel op het spel staat. In plaats daarvan splitst de markt zich in tweeën: dure, grensverleggende modellen worden ingezet voor de cognitieve taken met de hoogste toegevoegde waarde, terwijl goedkopere modellen het veel grotere volume aan routinematige gevolgtrekkingen voor hun rekening nemen.
De strategische vraag is dan ook niet langer louter wie over het meest geavanceerde model beschikt. Het gaat in toenemende mate om ”Wie kan het vereiste niveau van inlichtingen leveren tegen de laagste betrouwbare kosten per eenheid??”
Open weegsystemen versnellen de commoditisering
Ook Chinese modelaanbieders hebben een andere commerciële strategie gevolgd: open gewichten.
DeepSeek, Qwen, GLM, Kimi en andere Chinese modelfamilies hebben in verschillende mate downloadbare gewichten vrijgegeven, vaak onder soepele licenties. Daarentegen, Toonaangevende westerse aanbieders blijven zich voornamelijk richten op gesloten API-ecosystemen.
De twee benaderingen weerspiegelen verschillende economische modellen. Gesloten modellen genereren inkomsten uit schaarse cognitieve capaciteiten door middel van exclusieve toegang. Open-weight-modellen gebruiken het model zelf als een mechanisme voor acceptatie, waardoor de concurrentie zich verplaatst naar de volgende schakels in de keten: infrastructuur voor inferentie, cloud-diensten, ontwikkeltools, fijnafstemming en bedrijfsintegratie.
De lancering van DeepSeek-R1 in januari 2025 vormde een belangrijk keerpunt. Naarmate de modelgewichten van hoogpresterende modellen steeds toegankelijker werden, verloor het basismodel zelf zijn rol als concurrentievoordeel.
Zodra de modelgewichten de marginale distributiekosten van nul benaderen, het concurrentieveld verschuift naar de inferentie-economie en de bedrijfslaag. Dit is de kern van commoditisering: wanneer intelligentie in overvloed aanwezig is, verschuiven de schaarse middelen naar andere gebieden.
De tokeneconomie vertoont steeds meer kenmerken van een grondstoffenmarkt
De structuur die zich rond tokens begint te ontwikkelen, vertoont nu al kenmerken van een volwassen grondstoffenmarkt:
- Prijsdifferentiatie: De kosten voor inferentie van hetzelfde model kunnen sterk verschillen, afhankelijk van de aanbieder, de regio en de infrastructuur.
- Routering en arbitrage: Platforms zoals OpenRouter bieden gebruikers de mogelijkheid om dynamisch een keuze te maken uit verschillende modellen en aanbieders op basis van prijs, latentie en doorvoersnelheid.
- Gedifferentieerde prijsstelling: Dienstverleners hanteren steeds vaker verschillende tarieven op basis van prioriteit, snelheid, batchverwerking en gegarandeerde capaciteit.
- Quota’s en toewijzing: Gebruikslimieten en bedrijfsniveaus zorgen ervoor dat schaarse rekencapaciteit op effectieve wijze wordt toegewezen op basis van de waarde voor de klant en de vraag.
- Financialisering: Opkomende indexen en futures op rekenkracht wijzen op een toekomst waarin ondernemingen hun rekenkrachtbehoefte wellicht op vrijwel dezelfde wijze zullen beheren als andere variabele inputkosten.
Het resultaat is een snelle verkorting van de grondstoffencyclus. Routing, caching, modelvervanging en goedkope elektriciteit bieden allemaal een oplossing voor hetzelfde onderliggende probleem: Hoe de kosten voor het leveren van bruikbare inlichtingen tot een minimum kunnen worden beperkt. En op de grondstoffenmarkten zijn de economische aspecten per eenheid uiteindelijk van belang.
Het Artefact-perspectief: Ondernemingen moeten hun tokeneconomie beheren
Voor ondernemingen zou tokeneconomie daarom een managementdiscipline moeten worden, en niet louter een infrastructuurkwestie.
1. Beschouw tokens als een FinOps-kwestie: De kosten van AI moeten worden gekoppeld aan bedrijfsresultaten. Hoeveel tokens zijn er nodig om een supportticket af te handelen? Wat zijn de tokengelden voor een geautomatiseerd pull-verzoek? Wat zijn de gemiddelde AI-kosten per klantinteractie? Zonder deze toewijzing kunnen ondernemingen geen onderscheid maken tussen productief AI-gebruik en verspilling.
2. Maak van multi-model-routing een architectonisch principe: Frontier-modellen zouden niet voor elke taak de standaardoplossing moeten zijn. Ondernemingen zouden de mogelijkheden van het model dynamisch moeten afstemmen op de complexiteit van de taak, ondersteund door intelligente routering, caching en observeerbaarheid. De blijvende waarde zal in toenemende mate buiten het model liggen: eigen workflows, bedrijfscontext, coördinatielogica, domeinexpertise en betrouwbare data.
3. Beoordeel Chinese tokens op pragmatische wijze: Het toenemende kostenverschil tussen Chinese en westerse modellen verdient een grondige evaluatie, met name voor werkbelastingen met een groot volume en een lagere gevoeligheid.
Voor gevoelige data-toepassingen kunnen open-weight-modellen die in particuliere of overheidsomgevingen worden ingezet, meer controle bieden over de opslaglocatie en infrastructuur van data. Voor gestandaardiseerde, veelvuldig uitgevoerde taken kunnen kostenefficiënte API-eindpunten aanzienlijke verbeteringen opleveren wat betreft de kosten per eenheid.
4. Houd rekening met dalende modelkosten in bedrijfsmodellen: De prijzen van modellen zullen blijven dalen. Duurzame marges zullen daarom minder afhangen van de toegang tot ruwe informatie en meer van workflow-integratie, het eigen data-systeem, coördinatie, domeinexpertise en het vertrouwen van de klant.
5. Zet energie hoog op de agenda van de AI-strategie: Voor technologiebedrijven, cloud-aanbieders, fabrikanten en beleidsmakers is AI-infrastructuur niet langer los te zien van de energiestrategie. Het volgende concurrentievoordeel komt wellicht niet voort uit het bezit van het slimste model, maar uit het veiligstellen van ruime, robuuste en betaalbare rekenkracht.
Conclusie: De verschuiving van ‘smart’ naar hoge kwaliteit/lage kosten
De belangrijkste concurrentiefactor op het gebied van AI is verschoven van “Welk model is het slimst?” naar “Wie kan tegen de laagste kosten tokens van hoge kwaliteit genereren en leveren??”
Aangezien een token in wezen neerkomt op gecristalliseerde rekenkracht en elektriciteit, zal de toekomstige kaart van AI-dominantie niet uitsluitend worden bepaald door vooraanstaande onderzoekslaboratoria, maar door de verdeling van een overvloedige, kostenefficiënte en veerkrachtige energie-infrastructuur.

BLOG





