Schnelle Antworten für weniger Token-Verbrauch
Wenn Sie den Token-Verbrauch schnell senken müssen, beginnen Sie bei den wiederkehrenden Workflows: veraltete Coding-Sessions komprimieren, kleinere Datei-Ausschnitte senden, die Ausgabelänge begrenzen und Agenten-Schleifen stoppen, sobald sie dieselbe gescheiterte Strategie wiederholen. Diese Änderungen bringen meist mehr, als jeden einzelnen Prompt umzuschreiben.
Was ist der schnellste Weg, den Token-Verbrauch zu senken?
Entfernen Sie irrelevanten Context, bevor das Modell ihn sieht. Fügen Sie die fehlschlagende Funktion, die exakte Fehlermeldung und den auslösenden Befehl ein statt der ganzen Datei, der kompletten Terminal-Historie oder eines Repository-Dumps. Fordern Sie dann die kürzeste nützliche Ausgabe an: Patch, Checkliste oder Entscheidungstabelle.
Wie reduziere ich den Token-Verbrauch von Claude Code?
Halten Sie Claude-Code-Sessions eng gefasst. Nutzen Sie /compact, wenn der aktuelle Context noch gebraucht wird, /clear vor einem Aufgabenwechsel, und zerlegen Sie breite Aufträge in die Kontrollpunkte Untersuchen, Patchen und Verifizieren. Eine einzige lange Session kann teuer werden, wenn jeder Turn alte Dateien, Logs und gescheiterte Versuche mitschleppt.
Wie stoppe ich Agenten-Schleifen, bevor sie das Budget verbrennen?
Pausieren Sie den Lauf, wenn der Agent über mehrere Turns dieselbe Fehlerklasse wiederholt, ohne den Zustand zu ändern. Prüfen Sie das Diff und den echten Fehler, und starten Sie dann mit einem kleineren Ziel neu: eine Datei, ein fehlschlagender Test, eine erwartete Ausgabe. Wer Schleifen früh stoppt, schützt Token und Ratenlimit-Reserven zugleich.
Messen, bevor Sie optimieren
Token-Verschwendung lässt sich mit Intuition kaum beheben. Ein Prompt, der kurz wirkt, kann ein großes verstecktes Context Window mit sich tragen. Ein Coding-Agent, der beschäftigt aussieht, kann mehrere Turns damit verbringen, dieselbe gescheiterte Strategie zu wiederholen. Ein günstigeres Modell kann die richtige Antwort für Zusammenfassungen und Klassifikation sein, aber die falsche für eine subtile Architekturentscheidung.
Beginnen Sie mit dem Messen. Anthropic dokumentiert Token-Zählung und die Kostenbefehle von Claude Code. OpenAI weist gecachte Token in der Nutzung aus und empfiehlt, Ausgabe-Token zu reduzieren und abgerufenen Context zu filtern. Auch Gemini liefert Anleitungen zur Token-Zählung für API-Workflows. Sobald Sie Eingaben, Ausgaben und Cache-Verhalten sehen können, wird Token-Reduktion zu Engineering statt Folklore.
Arbeitsregel: Optimieren Sie nicht jeden Prompt. Optimieren Sie die wiederkehrenden Prompts, die Long-Context-Sessions, die automatisierten Agenten-Schleifen und die Anbieter-Workflows, die oft genug laufen, um ins Gewicht zu fallen.
Die sechs Hebel mit der größten Wirkung
1. Context-Ballast abbauen
Context wächst bei Coding-Arbeit unbemerkt. Dateien, Diffs, Terminal-Ausgaben, frühere Versuche und Standing-Anweisungen können alle Teil des nächsten Turns werden. Fragen Sie vor dem Absenden eines Prompts, ob das Modell wirklich die ganze Datei, das ganze Log oder nur die fehlschlagende Funktion und die exakte Fehlermeldung braucht.
2. Veraltete Sessions komprimieren oder zurücksetzen
Nutzen Sie in Claude Code /compact, wenn Sie den wichtigen Zustand bewahren, aber angesammeltes Rauschen entfernen wollen. Nutzen Sie /clear, wenn die nächste Aufgabe den alten Context gar nicht braucht. Sessions für mehrere Zwecke sind bequem, aber oft teuer.
3. Einfache Aufgaben an günstigere Modelle routen
Zusammenfassungen, Changelog-Entwürfe, Klassifikation, Fixture-Generierung und mechanische Umformulierungen brauchen selten das stärkste Modell. Reservieren Sie Premium-Modelle für mehrdeutiges Debugging, Architektur-Abwägungen und Aufgaben, bei denen eine falsche Antwort mehr kostet als die Token.
4. Ausgabelänge kürzen
Ausgabe-Token sind oft die teure Seite des Aufrufs. Fordern Sie genau das Antwortformat an, das Sie brauchen: nur den Patch, nur Stichpunkte, nur die Befehlsausgabe oder eine kurze Diagnose gefolgt vom Fix. Bezahlen Sie nicht für Erzählung, wenn die Aufgabe eine Antwort braucht.
5. Verrauschte Eingaben vorverarbeiten
Logs, PDFs, Repository-Dumps und generierte Dateien sollten gefiltert werden, bevor das Modell sie sieht. Behalten Sie den Fehler, die umliegenden Zeilen, die relevante Funktion und den Befehl, der die Ausgabe erzeugt hat. Entfernen Sie wiederholte Stacktraces, minifizierte Dateien, Lockfile-Rauschen und Logs ohne Bezug zur Aufgabe.
6. Durchdrehende Schleifen stoppen
Agentische Workflows können viel Geld verbrennen, während sie feststecken. Wenn ein Agent über mehrere Turns an derselben Fehlerklasse arbeitet, ohne den Zustand zu ändern, pausieren Sie den Lauf. Lesen Sie das Diff, prüfen Sie den tatsächlichen Fehler und lenken Sie die Aufgabe mit engeren Anweisungen neu.
Workflow-Gewohnheiten für Claude Code
Claude Code ist stark, weil es über ein ganzes Projekt hinweg arbeiten kann — genau diese Stärke macht Context-Disziplin so wichtig. Halten Sie stabile Projektregeln in CLAUDE.md. Setzen Sie kurze Aufgabengrenzen. Komprimieren Sie zwischen nicht zusammenhängenden Features. Leeren Sie die Historie, bevor Sie von der Implementierung zu einer anderen Untersuchung wechseln.
Anthropics Kosten-Dokumentation zu Claude Code beschreibt Befehle wie /cost, das Leeren des Contexts und die Komprimierung. Behandeln Sie diese als Teil des Workflows, nicht als Aufräumaktion, nachdem etwas bereits schiefgelaufen ist.
Speziell zum Thema Ratenlimit-Druck gibt es die ausführliche Erklärung (auf Englisch): why Claude Code rate limits happen. Wenn Sie Ihre Reserven während der Arbeit sichtbar halten wollen, finden Sie die Produktseite hier: Claude Code Rate-Limit-Tracker.
API- und App-Workflows
In API-Produkten entsteht Token-Optimierung meist aus Wiederholbarkeit: stabile Prompt-Präfixe, kleinerer abgerufener Context, Ausgabelimits und Modell-Routing. OpenAI und Anthropic dokumentieren beide das Verhalten ihres Prompt Caching. Das praktische Muster ist einfach: Halten Sie gemeinsame Anweisungen stabil und platzieren Sie dynamische Inhalte spät im Prompt, damit wiederholte Präfixe leichter wiederverwendet werden können.
Bei Retrieval-Systemen gilt: Senden Sie nicht jeden Dokument-Chunk, nur weil er nützlich sein könnte. Filtern Sie aggressiv, entfernen Sie Duplikate und begrenzen Sie die Context-Menge pro Antwort. Messen Sie bei Endnutzer-Apps Cache-Trefferquoten und Ausgabelänge, bevor Sie an der Modellqualität drehen.
Wenn sich Ihre Kosten über mehrere Anbieter verteilen, finden Sie die breiteren Einstiege in unseren deutschen Guides, den häufigen Fragen und der Preisübersicht von Tokens 4 Breakfast.
Anbieter-spezifische Playbooks
Claude Code: Zustand bewahren, Rauschen entfernen
Claude Code ist am stärksten, wenn es den richtigen Projekt-Context hat, und am schwächsten, wenn eine Session zu viel veraltete Historie mitträgt. Halten Sie stabile Anweisungen im Projektleitfaden, fordern Sie begrenzte Diffs an, komprimieren Sie, solange die Session noch relevant ist, und leeren Sie den Context beim Wechsel zu themenfremder Arbeit. Wenn der Ratenlimit-Druck steigt, schließen Sie den aktuellen Patch ab, bevor Sie die nächste breite Untersuchung anstoßen.
Cursor: Nicht aus Gewohnheit den ganzen Workspace senden
Cursor-Workflows können teuer werden, wenn jede Frage große Dateien, generierte Ausgaben oder alte Terminal-Logs mit hineinzieht. Markieren Sie nur die relevante Funktion, den fehlschlagenden Test, das Interface oder das Diff. Bitten Sie bei mehrdeutigen Aufgaben zuerst um einen Plan und verengen Sie die Implementierungsanfrage dann auf die Dateien, die sich tatsächlich ändern müssen.
OpenAI API: Ausgabe und wiederholte Präfixe kontrollieren
Reduzieren Sie bei API-Arbeit zuerst die Ausgabe-Token, denn wortreiche Antworten summieren sich schnell. Halten Sie stabile Anweisungen stabil, platzieren Sie dynamische Inhalte später und begrenzen Sie Antwortformate wenn möglich mit Schemas oder expliziten Strukturen. Nutzen Sie Prompt Caching, wo der Anbieter es unterstützt — aber messen Sie Cache-Trefferquoten, statt anzunehmen, dass der Cache nützliche Arbeit leistet.
Gemini und Recherche-Workflows: erst zusammenfassen, dann vertiefen
Recherche-Prompts laden zu langem Context und langen Antworten ein. Beginnen Sie mit einer engen Frage, fordern Sie Quellen-Extraktion oder eine kurze Entscheidungstabelle an und vertiefen Sie nur den Abschnitt, der wirklich zählt. Wenn eine Aufgabe breites Lesen erfordert, trennen Sie das Sammeln von der Synthese, damit Sie nicht wiederholt für denselben Context bezahlen.
Prompt-Muster gegen Token-Verschwendung
Breite Aufträge durch begrenzte Aufträge ersetzen
Schwacher Prompt: „Prüfe dieses ganze Repo und verbessere es.“ Besserer Prompt: „Untersuche nur die Dateien des Checkout-Flows, identifiziere das Conversion-Problem mit dem höchsten Risiko und schlage einen Patch vor, ohne fremde Module anzufassen.“ Der zweite Prompt senkt den Context, reduziert das Umherwandern und gibt dem Modell ein schärferes Erfolgskriterium.
Die Ausgabeform von Anfang an festlegen
Wenn Sie einen Patch brauchen, verlangen Sie einen Patch. Wenn Sie eine Diagnose brauchen, verlangen Sie drei Stichpunkte und den nächsten Befehl. Wenn Sie einen Vergleich brauchen, definieren Sie die Spalten. Die Ausgabeform ist einer der einfachsten Kostenhebel, denn jede unnötige Erklärung wird zu bezahlter Ausgabe.
Kontrollpunkte für agentische Arbeit nutzen
Bitten Sie den Agenten bei langen Coding-Aufgaben, nach der Untersuchung, nach dem ersten Patch und nach der Verifizierung zu stoppen. Kontrollpunkte verhindern, dass ein Modell Unsicherheit in teure Betriebsamkeit verwandelt. Sie machen es außerdem leichter zu erkennen, wann eine Aufgabe eine menschliche Entscheidung braucht statt einer weiteren automatisierten Schleife.
Wiederverwendbaren Context möglichst außerhalb des Chats halten
Projektregeln, Testbefehle, Stil-Entscheidungen und Deployment-Notizen gehören in Projektdateien, auf die der Agent gezielt zugreifen kann. Denselben Hintergrund in jedem Prompt zu wiederholen verschwendet Token und erhöht die Gefahr veralteter Anweisungen. Ein guter Repository-Leitfaden spart oft mehr Token als ein cleverer Einmal-Prompt.
Tools und Repos, die wirklich helfen
Tool-Listen sind nur nützlich, wenn sie zu einem Workflow passen. Diese hier lohnen sich, weil sie beim Zählen, Routen, Testen oder beim gezielten Verpacken von Context helfen.
Primärquellen
Dieser Leitfaden verzichtet auf Ratschläge, die von nicht überprüfbaren Tricks abhängen — etwa dem Austricksen eines Nutzungsfensters oder dem Meiden angeblicher Stoßzeiten. Die langfristig nützlichen Taktiken sind die, die Änderungen der Anbieter-Richtlinien überstehen.