Praktijknotities · Rekenkracht

Van elektriciteit naar tokens: wat AI-rekenkracht kost

Elke aanroep van een model kost rekenkracht. Bij gehoste modellen wordt een groot deel van dat gebruik gemeten in tokens. Elektriciteit is één van de inputs, maar chips, beschikbare capaciteit en de modelkeuze hebben meestal meer invloed op de prijs. Dat is van belang wanneer een bedrijf agents begroot.

Gepubliceerd door Aitonomy We runnen agent workforces voor organisaties. Hier leggen we vast wat daarvoor werkelijk nodig is. Wat we doen

Elke aanroep van een model kost rekenkracht. Wanneer een bedrijf een gehost model gebruikt, meet de aanbieder een groot deel van dat gebruik meestal in input- en outputtokens. De prijs op de factuur is het eindpunt van een fysieke keten die begint bij elektriciteit en via een datacenter, chips en de software voor het model loopt.

In die keten gebeuren twee dingen tegelijk. De kosten om een vast prestatieniveau te bereiken, dalen snel. Tegelijkertijd kunnen de nieuwste chips en modellen duurder worden wanneer de vraag sneller groeit dan het aanbod. Beide zijn van belang voor een bedrijf dat agents inzet, want een agent kan tijdens één case veel modelaanroepen doen.

Dit artikel volgt de keten met cijfers die in september 2026 beschikbaar waren. We houden metingen, marktwaarnemingen en prognoses uit elkaar. Illustratieve berekeningen vermelden hun aannames.

Hoe wordt elektriciteit een token?

Een elektriciteitscentrale en een netaansluiting leveren stroom aan een datacenter. De locatie zet die om in gekoelde, gestabiliseerde stroom voor servers. Chipfabrieken maken van wafers, geheugen en verpakkingen AI-chips. Die chips voeren via een softwarelaag een model uit, dat verzoeken omzet in tokens.

De onderdelen van de keten groeien niet even snel. Software kan in weken verbeteren. Het ontwerpen en produceren van een nieuwe chipgeneratie kost jaren. Datacenters vragen jaren bouwtijd en de netaansluiting kan nog langer duren. De langzaamste schakel bepaalt hoe snel de capaciteit groeit.

VAN ELEKTRICITEIT NAAR TOKENS 1Energie 2Locatie 3Silicium 4Chips 5Model 6Tokens GEBRUIKELIJK TEMPO Net: jarenBouw: jarenFabs: jarenCapaciteit: snelSoftware: snellerVraag: snelst TEMPO IS INDICATIEF. BRONNEN: IEA, EPOCH AI, GOOGLE, SEMIANALYSIS.
De fysieke schakels hebben de langste doorlooptijd. Betere software kan meer tokens uit bestaande hardware halen, maar geen netaansluiting of chipfabriek maken.

De schaal aan de rechterkant is al groot. Google meldde dat het in mei 2026 via zijn producten en API’s meer dan 3,2 biljard tokens per maand verwerkte, zeven keer zoveel als een jaar eerder. Dit is het door één bedrijf gerapporteerde volume en geen meting van de hele markt. Het laat wel zien hoe snel de vraag kan bewegen.

Hoeveel elektriciteit gebruikt een token?

Daar is geen universeel getal voor. Het energieverbruik verandert met het model, de hardware, de lengte van de input en output, batching, benutting en wat er in de meting wordt meegenomen. Een cijfer dat alleen de actieve AI-chip meet, ligt lager dan een meting die ook hostmachines, ongebruikte reservecapaciteit en koeling meetelt.

Google publiceerde een van de completere openbare metingen. Een mediaan tekstverzoek in Gemini Apps gebruikte in mei 2025 0,24 wattuur. De methode omvat AI-accelerators, hostmachines, ongebruikte capaciteit en de overhead van het datacenter. Google meldde ook dat het energieverbruik per mediaan verzoek in twaalf maanden met een factor 33 was gedaald. Het bedrijf publiceerde niet hoeveel tokens het mediane verzoek bevatte. De resultaten zijn niet onafhankelijk geverifieerd.

Voor een vertaling van het verbruik per verzoek naar verbruik per token zijn dus aannames nodig. In combinatie met openbare schattingen voor hardware en workloads ontstaat de volgende orde van grootte:

Eén miljoen tokensIllustratieve bandbreedteWat dit betekent
Elektriciteit0,1 tot 1 kWhEen brede schatting voor het draaien van modellen, geen benchmark. Een workload met veel context en redeneerstappen kan erbuiten vallen
Elektriciteit tegen een industrieel tarief in Texasongeveer $0,01 tot $0,07Bij 6,6 dollarcent per kWh, vóór een eventuele marge van de aanbieder
Elektriciteit tegen het EU-gemiddelde voor niet-huishoudensongeveer €0,02 tot €0,18Bij 18,4 eurocent per kWh. Grote datacenters betalen normaal niet dit gemiddelde tarief

De bandbreedte geeft gevoel voor de schaal, maar is niet geschikt om aanbieders te vergelijken. Een tokenprijs betaalt ook voor chips, netwerkapparatuur, het gebouw, modelontwikkeling, software, gereserveerde capaciteit en de marge van de aanbieder. Epoch AI begroot een AI-datacenter van één gigawatt op ongeveer 38 miljard dollar aan initiële investeringen. Servers vormen 56 procent van die schatting en de faciliteit 30 procent. De jaarlijkse elektriciteitskosten zijn met ongeveer 0,6 miljard dollar aanzienlijk, maar lager dan de jaarlijkse afschrijving en financiering van de hardware.

Een gigawatt in perspectief

Een IT-belasting van één gigawatt die continu draait, gebruikt vóór koeling en andere overhead 8,76 terawattuur per jaar. Bij een benutting van 70 procent is dat 6,1 TWh. Nederlandse datacenters kregen in 2024 samen 5,1 TWh geleverd, volgens het CBS. Dit is een vergelijking van schaal, geen één-op-één schatting van een faciliteit.

Waarom kan stroom toch het knelpunt zijn?

Elektriciteit vormt misschien een bescheiden deel van de tokenprijs, maar toegang tot stroom groeit langzaam mee. Volgens het IEA kost de bouw van een datacenter twee tot drie jaar. Een nieuwe netaansluiting in Europa kan, afhankelijk van land en locatie, twee tot tien jaar duren.

De vraag groeit sneller dan het elektriciteitssysteem als geheel. Het IEA meldt dat het stroomverbruik van datacenters in 2025 met 17 procent groeide, tegenover 3 procent voor het totale elektriciteitsverbruik. In de centrale prognose stijgt het wereldwijde verbruik van datacenters van 485 TWh in 2025 naar ongeveer 950 TWh in 2030. Die prognose is voorwaardelijk. Financiering, rendement, beschikbaarheid van apparatuur en ruimtelijke besluiten kunnen de uitkomst veranderen.

De levertijd van apparatuur vormt een extra beperking. Volgens het IEA steeg het aantal bestellingen voor gasturbines in 2025 met 70 procent. GE Vernova meldde in juli 2026 116 GW aan orderportefeuille en reserveringen voor gasinstallaties. Opwekking naast een datacenter kan een wachtrij voor het net omzeilen, maar blijft afhankelijk van schaarse apparatuur, vergunningen en brandstof.

In Nederland wordt die doorlooptijd zichtbaar. Datacenters ontvingen in 2024 4,6 procent van de Nederlandse elektriciteit. In 2026 oordeelde een rechter dat TenneT een aansluiting van 70 MW in Vijfhuizen mocht uitstellen tot het regionale net is verzwaard. Volgens de NOS wordt tussen 2033 en 2035 voldoende capaciteit verwacht. De aansluitdatum bepaalt hier wanneer de capaciteit kan draaien, niet de prijs van de elektriciteit.

Hoe snel kan de chipcapaciteit groeien?

Epoch AI schat dat de wereldwijde rekenkracht van AI-chips sinds 2022 met ongeveer een factor 3,3 per jaar is gegroeid. Dat is uitzonderlijk snel voor fysieke infrastructuur, maar nog altijd langzamer dan sommige metingen van de vraag naar tokens. Het is bovendien een historische schatting, geen garantie dat dit tempo aanhoudt.

De chipproductie hangt van meer af dan de laatste assemblagestap. Geavanceerde logische chips, geheugen met zeer hoge bandbreedte, chipverpakking en lithografiemachines moeten allemaal op tijd beschikbaar zijn. ASML is de enige leverancier van EUV-lithografiesystemen voor de meest complexe lagen van geavanceerde chips. Nieuwe fabrieksruimte kost jaren om te bouwen voordat die machines kunnen worden geïnstalleerd.

High-bandwidth memory, meestal afgekort tot HBM, is een tweede beperking. Dit geheugen zit direct naast de processor en verplaatst modeldata snel genoeg om de chip aan het werk te houden. Het IEA verwacht dat het huidige tekort tot en met 2027 aanhoudt. Microsoft meldde dat zijn investeringen van 41 miljard dollar in het kwartaal tot en met juni 2026 mede werden beïnvloed door hogere prijzen voor componenten. Deze beperkingen leggen de chipproductie niet stil, maar maken het aanbod op korte termijn minder gevoelig voor een hogere vraag.

Waarom werd sommige rekenkracht in 2026 duurder?

Eén marktindicator bewoog tegen de bekende trend in. De index van SemiAnalysis voor H100-huurcontracten met een looptijd van één jaar steeg van $1,70 per GPU-uur in oktober 2025 naar $2,35 in maart 2026, een stijging van 38 procent. De index gaat over onderhandelde huurcontracten voor één type chip en één looptijd. Hij laat niet zien dat alle AI-rekenkracht 38 procent duurder is geworden.

De beweging is toch relevant. De H100 verscheen in 2022, waardoor nieuwere hardware de huurprijs normaal gesproken zou drukken. Een sterke vraag, volgeboekte capaciteit en hogere componentprijzen duwden de andere kant op.

Over het vervolg lopen de meningen uiteen. Dwarkesh Patel stelt dat de omzet van ontwikkelaars van de meest geavanceerde modellen veel sneller groeit dan het aanbod van rekenkracht. Wanneer betere modellen meer opleveren per eenheid rekenkracht, kunnen deze bedrijven meer bieden voor schaarse capaciteit. Epoch AI komt vanuit geschatte vraag en aanbod tot een vergelijkbaar scenario: de inferentiecapaciteit bij een vaste modelgrootte groeit met ongeveer een factor 3,4 per jaar, terwijl de geschatte potentiële vraag veel sneller groeit. Beide prognoses steunen op onzekere aannames. Ze beschrijven een risico, geen prijscurve om op te begroten.

VASTE BENCHMARKCAPACITEIT EN HUURPRIJS H100 LAAGSTE PRIJS OM GPT-4 OP MMLU TE EVENAREN, PER MILJOEN TOKENS $100$10$1$0,1 $37,50$0,18MRT 2023FEB 2025 H100, HUURCONTRACT VAN ÉÉN JAAR $3$2$1$0 $1,70$2,35OKT 2025MRT 2026+38% BRONNEN: EPOCH AI (LINKS); H100-HUURINDEX SEMIANALYSIS (RECHTS).
De prijs van modelprestaties en de prijs van ruwe rekenkracht meten iets anders. Een benchmarkresultaat werd veel goedkoper, terwijl één schaarse markt voor GPU-huur duurder werd.

Waarom kunnen dezelfde prestaties toch goedkoper worden?

Nieuwe hardware is maar een deel van het antwoord. Modellen worden kleiner en efficiënter, software verwerkt meer verzoeken op dezelfde hardware en aanbieders sturen eenvoudiger werk naar goedkopere systemen. Daardoor daalt de laagste prijs voor een vast niveau van benchmarkprestaties snel.

Epoch AI berekende dat de laagste prijs om de score van GPT-4 uit maart 2023 op de MMLU-benchmark te evenaren, in februari 2025 was gedaald van $37,50 naar $0,18 per miljoen tokens. Dit resultaat geldt voor deze benchmark en combineert input- en outputprijzen in een vaste verhouding. Het is niet de prijs van elke taak die GPT-4 kon uitvoeren. De daling verschilde sterk tussen de benchmarks die Epoch onderzocht.

Ook de kosten van aanbieders zijn gedaald. Google meldde dat het de kosten per eenheid voor Gemini in 2025 door verbeteringen aan modellen, efficiëntie en benutting met 78 procent verlaagde. Een goedkopere eenheid garandeert alleen geen lagere totaalfactuur. Meer gebruik, langere context, extra redeneerstappen en herstelpogingen kunnen de besparing opnemen.

Agents maken dat vraageffect concreet. Anthropic meldt dat agents binnen zijn eigen onderzoekssysteem ongeveer vier keer zoveel tokens gebruikten als chatinteracties. Systemen met meerdere agents gebruikten ongeveer vijftien keer zoveel. Die verhoudingen beschrijven één systeem, niet iedere agent. Het algemene punt blijft staan: de kosten van een agent hangen af van de manier waarop die een case afhandelt, niet alleen van de prijs per miljoen tokens.

Daarmee verdwijnt de schijnbare tegenstelling. De capaciteit van gisteren kan goedkoper worden, terwijl de nieuwste capaciteit en de benodigde hardware schaars blijven. Een bedrijf kan van de eerste ontwikkeling profiteren zonder de tweede te hoeven voorspellen, mits het kwaliteit kan meten en veilig van model kan wisselen.

Hoe begroot een bedrijf de rekenkracht voor agents?

Begin met de eenheid die voor het bedrijf telt: een afgeronde case van de vereiste kwaliteit. Tokenvolume is een input voor dat getal. Het is niet het resultaat.

Vier regels voor iedere agentrol

Meet het werk en stuur daarna op rekenkracht

  1. Meet de volledige kosten per afgeronde case.Neem input- en outputtokens, toolaanroepen, herstelpogingen, mislukte runs en de menselijke controle die nodig is mee. Vergelijk dit met de nulmeting in de businesscase.
  2. Gebruik het goedkoopste model dat voor de evals slaagt.Het matchen van facturen en het afhandelen van uitzonderingen kunnen verschillende modellen vragen. Routeer op taak en risico in plaats van overal het nieuwste model te gebruiken.
  3. Zorg dat een modelwissel mogelijk blijft.Houd prompts, tools en tests voldoende overdraagbaar om een andere aanbieder te beoordelen. Voer vóór de overstap de regressie-evals uit. Een lagere tokenprijs heeft geen waarde als de kwaliteit daalt of de beheersmaatregelen niet meer werken.
  4. Beoordeel prijs en gebruik samen.Maak een nieuwe prognose wanneer de agentrol, het aantal cases, de contextlengte of het model verandert. Stel een budgetgrens vast en onderzoek de oorzaak wanneer de kosten per case daarbuiten komen.

Dit is de manier waarop Aitonomy met agentkosten omgaat. We leggen de businesscase per agentrol vast vóór het besluit om te bouwen. In productie biedt Aitonomy Control de beheerde runtime, governance, monitoring en traceerbaarheid die nodig zijn om het werk met die nulmeting te vergelijken. Welke kostengegevens beschikbaar zijn, hangt ook af van de modelaanbieder en de integratie. Het maandelijkse oordeel kijkt daarom naar afgeronde cases, kwaliteit, uitzonderingen en volledige kosten, niet alleen naar tokenvolume.

Dezelfde discipline geldt voor een modelwissel. Een agentrol gaat pas over op een goedkoper model wanneer uit het bewijs blijkt dat dit nog steeds aan de vereiste kwaliteit en het afgesproken supervisieniveau voldoet. Dat hoort bij het draaien van een agent in productie, niet bij een eenmalige inkoopkeuze.

Ga er in de begroting niet vanuit dat AI alleen maar goedkoper wordt, of dat schaarste alles duurder blijft maken. Meet de kosten van het werk, houd de modelkeuze open en werk de businesscase bij met bewijs uit de operatie.

Veelgestelde vragen

Hoeveel elektriciteit gebruikt een AI-token?+
Daar is geen betrouwbaar universeel getal voor. Google mat in mei 2025 een mediaan tekstverzoek in Gemini Apps op 0,24 wattuur, maar publiceerde niet hoeveel tokens dat verzoek bevatte. Op basis van verschillende openbare gegevens komen wij voor een illustratieve bandbreedte uit op 0,1 tot 1 kilowattuur per miljoen tokens. Het werkelijke verbruik hangt af van het model, de hardware, de lengte van de input en output, de benutting en wat er wordt meegerekend.
Wordt AI-rekenkracht goedkoper of duurder?+
Beide kunnen tegelijk waar zijn. De laagste prijs voor een vast benchmarkniveau is snel gedaald, terwijl schaarse GPU-huurcapaciteit recent duurder werd. Een bedrijf moet daarom het model en de kosten per afgeronde case volgen, in plaats van ervan uit te gaan dat alle tokenprijzen dezelfde kant op bewegen.
Waarom is stroom een knelpunt voor AI?+
De elektriciteit zelf vormt vaak maar een klein deel van de prijs van een token van een frontiermodel, maar nieuwe opwekcapaciteit en netaansluitingen kosten jaren. Een datacenter kan klaar zijn voordat het elektriciteitsnet de aansluiting kan leveren. Stroom bepaalt daardoor waar en wanneer extra chips kunnen draaien.
Hoe begroot een bedrijf de tokenkosten van AI-agents?+
Begroot de volledige variabele kosten per afgeronde case, waaronder input- en outputtokens, toolaanroepen, herstelpogingen en menselijke controle. Kies het goedkoopste model dat slaagt voor de evals van de agentrol, zorg dat een modelwissel mogelijk blijft en vergelijk kosten en kwaliteit op vaste momenten met de goedgekeurde businesscase.

Bronnen en afbakening

Kijk en luister

Mik Nijhuis

Medeoprichter en Chief AI Officer

Mik ontwierp complexe bedrijfssystemen voor ABN AMRO, Aegon en Shell. Hij bouwt agentsystemen die capaciteit toevoegen zonder de controle weg te nemen die complexe organisaties nodig hebben.

Aitonomy bouwt en runt agentrollen voor terugkerend bedrijfswerk, begeleid in productie en gemeten aan een nulmeting die vóór de eerste live case is afgesproken.Wat we doen

Alle insights

Uit de praktijk

Hoe je een agent workforce werkelijk runt. De rollen die we in productie brengen en het bewijs achter de beslissingen.

Klaar wanneer jullie dat zijn

Breng één workflow mee.
Ga weg met een businesscase.

Breng ons het werk dat jullie teams vertraagt. We brengen het in kaart, meten wat het nu kost en kiezen pas een eerste rol als de cijfers die keuze ondersteunen.