In den vergangenen zwei Jahren lautete die entscheidende Frage im Bereich der KI ganz einfach: Welches Modell ist das intelligenteste? Diese Frage verliert zunehmend an Bedeutung. Die Modellebene entwickelt sich schneller als erwartet zu einer Massenware, wobei sich Leistungslücken, deren Schließung früher ein Jahr dauerte, nun innerhalb eines Quartals verringern – häufig durch technische Fortschritte außerhalb des Modells selbst. Daher kommt eine neue Variable in die Entscheidungsmatrix für KI hinzu: Wie viel kostet ein Wertmarke?

Das Token hat sich weit über seine technische Definition als Untereinheit eines Wortes hinaus weiterentwickelt.

  • An einen Makler, ein Token ist die grundlegende Arbeitseinheit.
  • An einen Finanzvorstand, ein Token stellt einen neu entstehenden Betriebsaufwand dar.
  • Auf den Markt, ein Token verhält sich zunehmend wie eine handelbare Ware, mit verschiedenen Anbietern, Preisen, Routing-Mechanismen und sogar neu entstehenden Finanzinstrumenten.

Unsere zentrale These ist einfach: Die Token-Ökonomie ist im Grunde genommen eine Energieökonomie, die durch Software verschleiert wird.. Da sich die Leistungsmerkmale der Modelle immer mehr angleichen, wird die Fähigkeit, zuverlässige Token zu geringeren und besser kalkulierbaren Kosten zu generieren und zu verteilen, zu einer zunehmend wichtigen Quelle für Wettbewerbsvorteile werden.

Agenten haben die wirtschaftlichen Rahmenbedingungen der KI neu definiert

Herkömmliche Chat-Oberflächen stellten eine natürliche Grenze für die Nutzung von KI dar: Menschen sind langsam. Ein Nutzer stellt eine Frage, wartet auf eine Antwort, liest diese und formuliert die nächste Eingabeaufforderung. Die menschliche Interaktion ist daher wirkt als Begrenzer für den Token-Verbrauch.

Die Mitarbeiter entfernen diese Drosselklappe. Ein Programmieragent kann eine Aufgabe planen, Dateien prüfen, Tools aufrufen, Befehle ausführen, Ergebnisse auswerten, Fehler korrigieren und den Vorgang wiederholen. Mit jeder Iteration kann der an das Modell zurückgegebene Kontext erweitert werden. Nach Schätzungen der Branche beläuft sich das Arbeitsvolumen von Agenten üblicherweise auf Je nach Aufgabe 10- bis 50-mal so hoher Token-Verbrauch wie bei herkömmlichen Interaktionen mit nur einer Gesprächsrunde.

Dies verändert die wirtschaftlichen Rahmenbedingungen der KI. Mit zunehmender Verbreitung von Agenten hängt der Token-Verbrauch weniger von der menschlichen Nutzung ab, sondern vielmehr von Maschinenausführung. Der Markt reagiert bereits: Die intensive Nutzung hat KI-Produkte wie Cursor und Claude Code dazu gezwungen, ihre festen Abonnementmodelle zu überdenken, die Einführung von Nutzungsbeschränkungen oder zusätzlichen Gebühren wenn eine kleine Anzahl von Nutzern unverhältnismäßig große Rechenkapazitäten in Anspruch nimmt.

Die logische Antwort lautet Multi-Modell-Routing. Nicht jeder Schritt in einem Agenten-Workflow erfordert ein „Frontier“-Modell. Komplexe Planungsaufgaben können einem Premium-Modell zugewiesen werden, während das Abrufen von Informationen, die Zusammenfassung, die Klassifizierung oder die Ausführung von Routine-Tools von kleineren, kostengünstigeren Modellen übernommen werden können. Forschungsframeworks wie RouteLLM und FrugalGPT haben gezeigt, dass Es sind erhebliche Kosteneinsparungen möglich, ohne dass die Leistung entsprechend beeinträchtigt wird..

Dies ist der Ort, an dem die Agenten-Kabelbaum erhält strategische Bedeutung. Das „Harness“ – die Ebene, die für die Planung, die Koordination der Tools, das Kontextmanagement, die Fehlerbehebung und die Integrationen zuständig ist – kann Schwächen des zugrunde liegenden Modells ausgleichen.

Durch eine verbesserte Technik lässt sich daher die praktische Kluft zwischen teuren Spitzenmodellen und kostengünstigeren Alternativen verringern.
Die Auswirkungen sind erheblich: Der Intelligenzvorteil des Modells nimmt ab, während die Wirtschaftlichkeit der Inferenz an Bedeutung gewinnt.

Durch das Caching werden die physischen Kosten eines Tokens deutlich

Die Routenführung ist nur ein Aspekt der Token-Optimierung. Zwischenspeicherung von Eingabeaufforderungen greift das andere an: überflüssige Berechnungen.

Agenten-Workflows senden wiederholt dieselben Systemaufforderungen, Tool-Definitionen und den persistenten Kontext. Anstatt diese Token jedes Mal neu zu berechnen, können Anbieter die zugrunde liegenden KV-Zustände zwischenspeichern und wiederverwenden.

Große Anbieter gewähren mittlerweile erhebliche Rabatte für zwischengespeicherte Eingaben, in einigen Fällen Annäherung an 90%. Die genauen Preise variieren je nach Modell und Cache-Dauer, doch das wirtschaftliche Prinzip bleibt dasselbe: Sind Berechnungen bereits durchgeführt worden, ist die spätere Wiederverwendung deutlich kostengünstiger.

Diese Unterscheidung ist von Bedeutung, da ein Der Cache-Rabatt des 90% ist nicht dasselbe wie die Cache-Trefferquote des 90%. Wenn 90% Token zwischengespeichert werden und zwischengespeicherte Token nur 10% des Listenpreises kosten, betragen die gemittelten Kosten etwa 19% des ursprünglichen Preises: eine effektive Einsparung von etwa 80%.

Für die Finanzplanung von Unternehmen sind diese Unterscheidungen von Bedeutung. Bei der Token-Ökonomie geht es nicht lediglich um den Listenpreis, sondern um die effektiven Stückkosten unter realen Auslastungsbedingungen.

Das Caching macht zudem einen tiefer liegenden Zusammenhang deutlich. Warum ist ein zwischengespeichertes Token kostengünstiger? Weil weniger Rechenaufwand erforderlich ist. Weniger Rechenaufwand bedeutet weniger GPU-Zyklen. GPU-Zyklen verbrauchen Strom. Mit anderen Worten:, Der Preis eines Tokens spiegelt letztendlich die physische Infrastruktur wider.

Ein Token ist kristallisierte Elektrizität

Auf der Infrastrukturebene umfasst der Preis eines Tokens die GPUs und deren Wertminderung, die Kapazität des data-Rechenzentrums, die Netzwerkausstattung, die Kühlung und vor allem, Strom.

Die genaue Kostenaufschlüsselung variiert je nach Architektur und Abrechnungsmethode, doch die Tendenz ist eindeutig: Mit zunehmendem Umfang der KI-Inferenz, Energie entwickelt sich zu einem der wichtigsten einschränkenden Faktoren für die Wirtschaftlichkeit der künstlichen Intelligenz.

Die Zahlen sind bereits erheblich. Eine typische KI-Interaktion verbraucht zwar nur einen Bruchteil einer Wattstunde, doch multipliziert man dies mit Hunderten von Milliarden Interaktionen und berücksichtigt zudem agentenbasierte Arbeitsabläufe, die wiederholtes logisches Schlussfolgern und den Aufruf von Tools beinhalten, ergibt sich ein enormer Gesamtbedarf.

Die Internationale Energieagentur geht davon aus, dass sich der weltweite Stromverbrauch auf 950 TWh bis 2030, was fast einer Verdopplung gegenüber dem Niveau von 2025 entspricht.

Die geografische Lage spielt daher eine wichtige Rolle. Die Strompreise für die Industrie variieren erheblich zwischen den wichtigsten KI-Märkten, während China die Erzeugung erneuerbarer Energien mit außerordentlicher Geschwindigkeit ausgebaut und im Rahmen seiner Strategie “East Data, West Computing” massiv in die energiereichen westlichen Regionen investiert hat.

Software-Intelligenz lässt sich innerhalb weniger Monate weltweit skalieren, doch günstiger, zuverlässiger Strom Das ist nicht möglich. Der Aufbau von Erzeugungskapazitäten, Übertragungsinfrastruktur und data-Zentren erfordert jahrelange Kapitalinvestitionen. Da Modellfähigkeiten zunehmend austauschbar werden, wird der Zugang zu reichlich vorhandener und kostengünstiger Rechenleistung zu einem nachhaltigeren Wettbewerbsvorteil.

Token machen Energie zu einer weltweit handelbaren Dienstleistung

Strom selbst lässt sich nur schwer grenzüberschreitend exportieren. Stromnetze sind nach wie vor grundsätzlich regional geprägt. Token lösen dieses Problem.

Im Inneren eines data-Centers, Strom wird zur Rechenleistung. Rechenleistung wird in Token umgewandelt. Token können anschließend über APIs und Glasfasernetzwerke sofort an Nutzer überall auf der Welt übertragen werden. Das Token ist somit eine Form von digitalisierte Energie: Physikalische Energie, die in eine weltweit verfügbare Dienstleistung umgewandelt wird.

Dies trägt dazu bei, die zunehmende Wettbewerbsfähigkeit chinesischer KI-Modelle zu erklären. Branchenschätzungen zufolge können die Inferenzkosten führender chinesischer Modelle deutlich unter denen westlicher Pendants liegen, wobei der genaue Unterschied je nach Modell, Anbieter und Arbeitslast variiert.

Die Reaktion des Marktes wird immer deutlicher. OpenRouter und andere Routing-Plattformen ermöglichen es Entwicklern, Modelle hinsichtlich Preis, Latenz und Leistung zu vergleichen und den Datenverkehr dynamisch umzuleiten. Chinesische Modelle haben einen erheblichen Anteil am gerouteten Datenverkehr gewonnen, während Open-Weight-Modelle wie Qwen und DeepSeek in den globalen Entwickler-Ökosystemen zunehmend an Bedeutung gewinnen.
Dies bedeutet nicht, dass westliche Frontier-Modelle an Bedeutung verlieren. Premium-Modelle verfügen weiterhin über Preismacht bei komplexen Schlussfolgerungen mit hohem Risiko. Vielmehr spaltet sich der Markt auf: Teure Frontier-Modelle werden für die wertvollsten kognitiven Aufgaben eingesetzt, während kostengünstigere Modelle das weitaus größere Volumen an routinemäßigen Schlussfolgerungen abdecken.

Die strategische Frage lautet daher nicht mehr lediglich, wer über das leistungsfähigste Modell verfügt. Sie lautet zunehmend ”Wer kann das erforderliche Niveau an Informationen zu den niedrigsten zuverlässigen Stückkosten bereitstellen??”

Offene Gewichtsangaben beschleunigen die Kommodifizierung

Chinesische Modellanbieter haben zudem eine andere Geschäftsstrategie verfolgt: offene Gewichtsklassen.
DeepSeek, Qwen, GLM, Kimi und andere chinesische Modellfamilien haben in unterschiedlichem Umfang Gewichte zum Herunterladen veröffentlicht, häufig unter freizügigen Lizenzen. Im Gegensatz dazu, Führende westliche Anbieter konzentrieren sich nach wie vor überwiegend auf geschlossene API-Ökosysteme.

Die beiden Ansätze spiegeln unterschiedliche Wirtschaftsmodelle wider. Geschlossene Modelle monetarisieren knappe kognitive Fähigkeiten durch proprietären Zugang. Bei Open-Weight-Modellen dient das Modell selbst als Mechanismus zur Verbreitung, wodurch sich der Wettbewerb auf nachgelagerte Bereiche verlagert – hin zu Inferenzinfrastruktur, cloud-Diensten, Entwicklertools, Feinabstimmung und Unternehmensintegration.

Die Veröffentlichung von DeepSeek-R1 im Januar 2025 markierte einen wichtigen Wendepunkt. Da leistungsstarke Modellgewichte zunehmend zugänglich wurden, verlor das Grundmodell selbst zunehmend an Bedeutung als Wettbewerbsvorteil.

Sobald sich die Modellgewichte den Grenzkosten der Verteilung von Null annähern, Das Wettbewerbsfeld verlagert sich auf die Bereiche Inferenzökonomie und die Unternehmensebene. Das ist der Kern der Kommodifizierung: Wenn Intelligenz im Überfluss vorhanden ist, verlagern sich die knappen Ressourcen an andere Stellen.

Die Token-Ökonomie gleicht zunehmend einem Rohstoffmarkt

Die Struktur, die sich rund um Token herausbildet, ähnelt bereits einem ausgereiften Rohstoffmarkt:

  • Preisdifferenzierung: Je nach Anbieter, Region und Infrastruktur können die Preise für die Inferenzauswertung desselben Modells erheblich variieren.
  • Routing und Arbitrage: Plattformen wie OpenRouter ermöglichen es den Nutzern, dynamisch zwischen verschiedenen Modellen und Anbietern auszuwählen, wobei sie sich an Preis, Latenz und Durchsatz orientieren.
  • Gestaffelte Preisgestaltung: Die Anbieter differenzieren ihre Preise zunehmend nach Priorität, Geschwindigkeit, Stapelverarbeitung und garantierter Kapazität.
  • Quoten und Zuteilung: Durch Nutzungsbeschränkungen und Unternehmensstufen werden knappe Rechenressourcen entsprechend dem Kundennutzen und dem Bedarf effektiv zugewiesen.
  • Finanzialisierung: Neue Indizes und Rechenleistungs-Futures deuten auf eine Zukunft hin, in der Unternehmen ihren Rechenleistungsbedarf ähnlich wie andere variable Inputkosten steuern könnten.

Die Folge ist eine rasche Verdichtung des Rohstoffzyklus. Routing, Caching, Modellersetzung und kostengünstiger Strom tragen alle zur Lösung desselben zugrunde liegenden Problems bei: Wie lassen sich die Kosten für die Bereitstellung aussagekräftiger Informationen minimieren?. Und auf den Rohstoffmärkten kommt es letztendlich auf die Stückkosten an.

Die Artefact-Perspektive: Unternehmen müssen ihre Token-Ökonomie steuern

Für Unternehmen sollte die Token-Ökonomie daher zu einer Managementdisziplin werden und nicht lediglich eine Frage der Infrastruktur bleiben.

1. Behandeln Sie Tokens als ein FinOps-Thema: Die KI-Kosten müssen an die geschäftlichen Ergebnisse gekoppelt werden. Wie viele Token sind erforderlich, um ein Support-Ticket zu bearbeiten? Wie hoch sind die Token-Kosten für einen automatisierten Pull-Request? Wie hoch sind die durchschnittlichen KI-Kosten pro Kundeninteraktion? Ohne diese Zuordnung können Unternehmen den produktiven KI-Einsatz nicht von Verschwendung unterscheiden.

2. Machen Sie die modellübergreifende Routing-Planung zu einem architektonischen Grundsatz: Frontier-Modelle sollten nicht für jede Aufgabe als Standard eingesetzt werden. Unternehmen sollten die Modellkapazitäten dynamisch an die Komplexität der jeweiligen Aufgabe anpassen, unterstützt durch intelligentes Routing, Caching und Observability. Der dauerhafte Wert wird zunehmend außerhalb des Modells liegen: proprietäre Arbeitsabläufe, Unternehmenskontext, Orchestrierungslogik, Fachwissen und bewährte data.

3. Chinesische Token pragmatisch bewerten: Die zunehmende Kostenunterschiede zwischen chinesischen und westlichen Modellen verdienen eine eingehende Bewertung, insbesondere bei Workloads mit hohem Volumen und geringer Sensitivität.
Bei sensiblen data-Anwendungen können Open-Weight-Modelle, die in privaten oder staatlichen Umgebungen eingesetzt werden, eine bessere Kontrolle über den Speicherort und die Infrastruktur von data ermöglichen. Bei standardisierten, hochfrequenten Aufgaben können kosteneffiziente API-Endpunkte erhebliche Verbesserungen der Stückkosten bewirken.

4. Berücksichtigen Sie sinkende Modellkosten in Ihren Geschäftsmodellen: Die Preise für Modelle werden weiter sinken. Nachhaltige Margen werden daher weniger vom Zugang zu Rohdaten und mehr von Workflow-Integration, die firmeneigene Lösung data, Orchestrierung, Fachkompetenz und Kundenvertrauen.

5. Setzen Sie das Thema Energie auf die Agenda der KI-Strategie: Für Technologieunternehmen, cloud-Anbieter, Hersteller und politische Entscheidungsträger ist die KI-Infrastruktur nicht mehr von der Energiestrategie zu trennen. Der nächste Wettbewerbsvorteil ergibt sich möglicherweise nicht aus dem Besitz des intelligentesten Modells, sondern aus der Sicherung reichlich verfügbare, ausfallsichere und kostengünstige Rechenleistung.

Fazit: Der Wandel von „smart“ hin zu „hochwertig und kostengünstig“

Die wichtigste Wettbewerbsachse im Bereich der KI hat sich von der Frage “Welches Modell ist das intelligenteste?” hin zu “Wer kann hochwertige Token zu den niedrigsten Kosten erstellen und bereitstellen??”

Da ein Token letztlich aus Rechenleistung und Strom besteht, wird die künftige Landschaft der KI-Dominanz nicht allein von elitären Forschungslabors bestimmt werden, sondern von der Verteilung von eine reichlich vorhandene, kostengünstige und widerstandsfähige Energieinfrastruktur.