Mit dem zunehmenden Einsatz generativer KI rückt der Tokenverbrauch stärker in den Fokus. Vor allem KI-Agenten können große Mengen an Kontext wiederholt verarbeiten, obwohl sie nur einen Teil davon tatsächlich benötigen. Der Datenanalyse-Experte Prof. Dr. Michael Berthold sieht deshalb in der gezielten Verdichtung und Strukturierung von Informationen einen wichtigen Ansatz. Context Engineering soll dafür sorgen, dass Modelle möglichst wenig, aber ausreichend relevanten Kontext erhalten.
Generative KI kann für Unternehmen einen Kostenfaktor erzeugen, der bei einzelnen Anfragen zunächst kaum auffällt: Modelle verarbeiten wiederholt Informationen, die für die jeweilige Aufgabe nicht oder nur teilweise erforderlich sind. Mit KI-Agenten gewinnt dieser Effekt an Bedeutung. Sie führen Aufgaben über mehrere Schritte hinweg aus und laden, analysieren und übertragen dabei Kontext immer wieder neu.
Prof. Dr. Michael Berthold, Experte für KI und Datenanalyse, verweist in diesem Zusammenhang auf Untersuchungen zum Tokenverbrauch bei agentischen Aufgaben. Eine im Ausgangstext angeführte Microsoft-Research-Studie zu Coding-Aufgaben kommt demnach zu dem Ergebnis, dass agentische Aufgaben bis zu 1.000-mal mehr Tokens als klassisches Code Reasoning verbrauchen können. Ausschlaggebend seien insbesondere Input-Tokens. Ein höherer Verbrauch führe dabei nicht zwangsläufig zu besseren Ergebnissen.
Eine weitere im Pressetext genannte Untersuchung zu agentischen Softwareentwicklungsaufgaben beschreibt den Effekt als „Communication Tax”: Bereits vorhandene Informationen werden von Agenten wiederholt weitergereicht, anstatt sie für nachfolgende Verarbeitungsschritte zu verdichten.
Ein Grund dafür sind große Context-Windows. Sie ermöglichen es, umfangreiche Datenmengen wie komplette Repositories, Dokumentensammlungen oder längere Gesprächsverläufe an ein Sprachmodell zu übergeben. Was bei einer einzelnen Anfrage praktikabel erscheinen kann, kann bei häufig wiederkehrenden Verarbeitungsschritten jedoch einen erheblichen Tokenverbrauch verursachen.
Als Beispiel nennt der Ausgangstext ein Repository mit 500.000 Tokens. Gelangt dieses bei 10.000 Interaktionen jeweils erneut in den Kontext, summiert sich die Verarbeitung auf Milliarden Tokens – selbst wenn sich der zugrunde liegende Datenbestand zwischenzeitlich nicht verändert hat.
Große Kontexte können die Qualität beeinträchtigen
Der Umfang des Kontextes ist dabei nicht ausschließlich eine Kostenfrage. Der Pressetext verweist auf die „Lost in the Middle”-Untersuchung von Liu et al., nach der Sprachmodelle relevante Informationen innerhalb langer Kontexte nicht an jeder Position gleich gut nutzen. Informationen in der Mitte eines langen Inputs können demnach schlechter berücksichtigt werden.
Auch Anthropic wird im Ausgangstext mit dem Ansatz angeführt, Kontext als begrenzte Ressource zu betrachten. Ziel sollte danach sein, möglichst wenige, dafür informationsreiche Tokens bereitzustellen. Ein größeres Context-Window allein stellt damit noch keine Garantie für eine bessere Verarbeitung dar.
Verdichtung ergänzt Retrieval
Retrieval-Augmented Generation, kurz RAG, kann die Menge der bereitgestellten Informationen bereits begrenzen. Statt sämtliche vorhandenen Dokumente in den Kontext zu laden, werden anhand einer Anfrage zunächst passende Inhalte ausgewählt.
Das löst das Mengenproblem allerdings nicht vollständig. Liefert ein RAG-System beispielsweise zehn Dokumente mit jeweils 20.000 Tokens zurück, muss das Modell weiterhin 200.000 Tokens verarbeiten. Bei ähnlichen Anfragen kann sich dieser Vorgang wiederholen.
Als nächsten Schritt beschreibt Berthold deshalb die Verdichtung beziehungsweise Abstraktion der Informationen. Aus umfangreichem Rohmaterial entsteht zunächst eine kompaktere Essenz. Auf deren Basis kann die KI entscheiden, welche Detailinformationen sie für die jeweilige Aufgabe tatsächlich benötigt. Erst anschließend werden beispielsweise einzelne Dateien oder Dokumente geladen.
Context Engineering strukturiert Informationen
Dieser Ansatz führt zum Context Engineering. Anthropic definiert den Begriff laut Ausgangstext als systematische Zusammenstellung und Pflege der Informationen, die ein Modell während der Inferenz erhält. Entscheidend ist damit nicht nur der eigentliche Prompt, sondern der gesamte Informationszustand, auf den ein Agent zugreifen kann.
Zur Strukturierung können unterschiedliche Ebenen dienen. Ein Semantic Layer beschreibt Begriffe, Typen und deren Bedeutung und kann beispielsweise kenntlich machen, wenn unterschiedliche Bezeichnungen dasselbe Geschäftskonzept meinen. Ein Knowledge Graph bildet dagegen Beziehungen zwischen Entitäten ab, etwa Abhängigkeiten zwischen Services, APIs und Komponenten.
Für Programmcode beschreibt der Pressetext ein ähnliches Konzept als Context Compiler. Statt ein vollständiges Repository bei jedem Verarbeitungsschritt neu einzulesen, erhält ein Coding-Agent zunächst eine strukturierte Übersicht über Architektur, Module, Abhängigkeiten, APIs und Datenflüsse. Bleibt das Repository unverändert, kann diese verdichtete Darstellung wiederverwendet werden.
Hierarchischer Zugriff statt vollständiger Rohdaten
Aus diesem Prinzip lässt sich eine Informationshierarchie ableiten. Auf der obersten Ebene steht eine kompakte Zusammenfassung, darunter folgen detailliertere Beschreibungen einzelner Bereiche. Die vollständigen Rohdaten bilden erst die unterste Ebene.
Ein KI-System kann sich damit schrittweise zu den benötigten Informationen vorarbeiten, anstatt bei jeder Anfrage sämtliche Ausgangsdaten einzulesen. Nach demselben Prinzip lassen sich laut Pressetext auch Skills organisieren: Ein Agent erhält zunächst Informationen darüber, wann eine bestimmte Fähigkeit relevant ist. Details zur konkreten Verwendung eines Werkzeugs werden erst bei Bedarf bereitgestellt.
Für Unternehmen verschiebt sich damit die Optimierungsfrage. Nicht allein die maximale Größe eines Context-Windows ist entscheidend, sondern die Menge an Informationen, die ein Modell tatsächlich benötigt, um den nächsten Verarbeitungsschritt zuverlässig festzulegen.
Quelle: M. Berthold/GCPR Network GmbH„Die KI-Branche hat lange auf immer größere Context-Windows optimiert – ein wichtiger Fortschritt. Für Unternehmen darf die Fenstergröße aber nicht selbst zum Ziel werden: Ein Context-Window ist kein kostenloser Speicher, sondern eine wiederholt zu verarbeitende Ressource, und wer einen Agenten mit riesigen Mengen Rohmaterial füttert, zahlt möglicherweise Milliarden Tokens für Informationen, die er nie oder nur selten braucht“, betont Michael Berthold.
Context Engineering zielt damit auf eine andere Form der Effizienz: Umfangreiche Rohdaten sollen nicht grundsätzlich aus dem Zugriff der KI verschwinden. Stattdessen werden ihnen verdichtete und strukturierte Informationen vorgeschaltet, anhand derer das System entscheiden kann, welche Details es im nächsten Schritt benötigt. Aufwendig erzeugter Kontext kann so mehrfach genutzt werden, anstatt bei jeder Interaktion erneut verarbeitet zu werden.
Hier finden Sie weitere Informationen zu Prof. Dr. Michael Berthold.
