Was ein vollständiger Loop kostet: 42 Millionen Tokens, 35 Dollar — und 96 % davon Cache
Sieben Rollen-Agenten über fünf Phasen: Ein gemessener Durchlauf, aufgeschlüsselt nach Rolle, mit den Einschränkungen, die dazugehören.
Die erste Frage, die ein Entwickler stellt, wenn er hört, dass sieben Agenten ein Feature durch fünf Phasen tragen, ist nicht „wie gut wird das Ergebnis". Sie lautet: was kostet mich das.
Die übliche Antwort in dieser Produktkategorie ist Schweigen. Also hier die Zahl, gemessen statt geschätzt.
Der Fall
todo-filter-bar — eine Filterleiste für eine Todo-App, gebaut am 19. September 2026 in einem Durchlauf. Von /spark mit einem Satz Feature-Idee bis v0.1.0 released. Alle fünf Phasen, sieben Rollen-Agenten, 29 Acceptance Criteria, QA im echten Browser auf Desktop und bei 375 px. 47 Minuten, fünf Gates, an jedem eine menschliche Entscheidung.
Es ist dieselbe Session, aus der das Demo-Video geschnitten ist.
Das Ergebnis
| Tokens gesamt | 42.307.448 |
| Zu API-Listenpreisen (Opus 5) | 35,52 $ |
| Dieselbe Arbeit ohne Prompt-Caching | 217,37 $ |
| Ersparnis durch Caching | 181,85 $ — 83,7 % |
Die erste Zahl ist die, bei der man erschrickt. Die letzte ist die, auf die es ankommt.
Warum 42 Millionen Tokens die falsche Größe sind
Von den 42,31 Millionen Tokens sind 40,76 Millionen Cache-Reads — 96,3 %.
Frischer Input über den gesamten Loop: 960 Tokens. Output: 291.732.
Ein gegateter Loop liest denselben Kontext immer wieder. Die Spec, die beim Planen vorliegt. Der Plan, den der Reviewer gegen den Diff hält. Die Acceptance Criteria, die QA einzeln abhakt. Genau diese Form von Arbeitslast ist der Fall, für den Prompt-Caching gebaut wurde — und deshalb kostet das Wiederlesen ein Zehntel des ersten Lesens.
Wer die Bruttozahl zitiert, misst die Datenmenge. Wer die Rechnung aufmacht, misst die Kosten. Das ist nicht dasselbe.
Aufschlüsselung nach Rolle
| Rolle | Output | Cache-Read | Cache-Write | Kosten |
|---|---|---|---|---|
| Hauptsession (Orchestrator + Gates) | 145.113 | 29.697.805 | 411.863 | 21,05 $ |
| QA-Tester | 38.576 | 7.365.329 | 281.134 | 6,41 $ |
| Reviewer | 25.416 | 1.787.327 | 161.016 | 2,54 $ |
| Product Owner | 39.135 | 682.356 | 128.610 | 2,12 $ |
| Release Manager | 16.023 | 980.193 | 103.122 | 1,54 $ |
| Engineering Manager | 16.846 | 178.398 | 82.279 | 1,02 $ |
| Designer | 10.623 | 69.156 | 86.168 | 0,84 $ |
Zwei Dinge fallen auf.
Die Hauptsession trägt 59 Prozent. Sie ist kein Agent, sondern der Orchestrator: Sie hält den Kontext über alle 47 Minuten, führt jedes Gate und spricht mit Ihnen. Die spezialisierten Rollen laufen als Subagenten mit eigenem, kürzerem Kontext — sie bekommen, was sie brauchen, und nicht die ganze Sitzung. Das ist der Grund, warum sechs Agenten zusammen weniger kosten als der eine Faden, der sie zusammenhält.
Der QA-Tester ist der teuerste Einzelagent. Das passt zur Sache: Er ist der Einzige, der tatsächlich einen Browser bedient — 29 Kriterien, per Maus und per Tastatur, einmal auf Desktop und einmal in einem 375 Pixel breiten Rahmen, dazu ein Durchlauf mit hundert Todos. Prüfen ist teurer als planen. Das sollte es auch sein.
Wie gerechnet wurde
Nicht aus dem Bauch und nicht aus einer Statusanzeige. Die Zahlen stammen aus den usage-Feldern der Claude-Code-Transkripte dieser Session: alle Assistant-Nachrichten der Hauptsitzung plus die zwölf Subagenten-Transkripte. Die Zuordnung zu den Rollen kommt aus den agentType-Feldern der zugehörigen Metadaten, nicht aus einer Zuordnung von Hand.
Preise, Stand heute, claude-opus-5, API-Liste:
| pro 1 Mio. Tokens | |
|---|---|
| Input | 5,00 $ |
| Output | 25,00 $ |
| Cache-Read | 0,50 $ |
| Cache-Write, 5-Minuten-TTL | 6,25 $ |
| Cache-Write, 1-Stunden-TTL | 10,00 $ |
Der Anteil der beiden TTLs ist nicht angenommen, sondern aus usage.cache_creation gelesen: 842.329 Tokens auf fünf Minuten, 411.863 auf eine Stunde.
Was diese Zahl nicht sagt
Ohne diesen Abschnitt wäre der Rest unredlich.
Es sind Listenpreise. Die Session lief über Claude Code. Wer ein Abonnement hat, hat diese 35,52 $ nicht bezahlt. Die Zahl beantwortet eine andere Frage: Was kostet diese Arbeitslast, wenn man sie zu API-Preisen abrechnet? Das ist die Vergleichsgröße für jemanden, der aSPARK gegen eine Alternative hält — nicht Ihre Abrechnung.
Es ist ein Modell. Opus 5. Mit einem günstigeren Modell sieht die Rechnung anders aus, und die Frage, ob das Ergebnis dann noch durch dieselben Gates kommt, ist offen.
Es ist ein Messpunkt. Ein Feature, eine kleine Anwendung, ein Projekt. Daraus einen Durchschnitt zu machen wäre genau die Sorte Verallgemeinerung, die dieses Projekt an anderer Stelle vermeidet. Ein zweiter Durchlauf auf einem größeren Feature wäre ehrlicher als dieser eine, hochgerechnet.
Die 47 Minuten sind nicht 47 Minuten Modellzeit. An fünf Gates hat ein Mensch gelesen und entschieden. Diese Zeit steht in der Uhr, aber nicht in der Rechnung.
Warum das hier steht
Weil niemand sonst diese Zahl nennt, und weil eine Software, die ihren Wert aus Nachprüfbarkeit zieht, bei der eigenen Kostenfrage nicht ausweichen darf.
Die Rechnung ist aus den Transkripten reproduzierbar. Wenn Sie aSPARK laufen lassen, können Sie Ihre eigene aufmachen — und wenn sie deutlich anders ausfällt, ist das ein Ergebnis, das uns mehr wert ist als dieses hier.