Der Cache entscheidet, welche Fragen sich ein Retail-Assistent leisten kann
Prompt-Caching rechnet sich nur, wenn dieselbe Frage wiederkommt, und ein Paper zu semantischem Caching zeigt für wiederholungsstarke Abfragekategorien Trefferquoten von 40 bis 60 Prozent gegenüber 5 bis 15 Prozent bei seltenen Kategorien. Diese Rechnung macht Katalogfragen billig – und macht die maßgeschneiderte Stilberatung, die jeder Anbieter vorführt, zur teuersten Frage, die man einem Assistenten stellen kann.
Neritus Vale
Jeder KI-Assistent im Handel ist auf die Wette kalkuliert, dass Kund:innen sich wiederholen. Einen gecachten Prompt zu lesen, kostet laut Anthropics veröffentlichter Preisliste nur ein Zehntel des normalen Input-Preises. Diesen Cache zu schreiben, kostet 25 Prozent mehr als gar nicht zu cachen – das gilt für die Standardvariante mit fünf Minuten Haltbarkeit; die Ein-Stunden-Option kostet doppelt so viel. Der Rabatt ist ein Kredit, der sich erst amortisiert, wenn derselbe Prompt zurückkommt – und das gleich zweimal, wenn der Cache auf der längeren Uhr läuft. Konversationelles Einkaufen bewegt sich gerade aus der Pilotphase in den produktiven Traffic, gestützt auf genau diese Annahme. Sie hält weit besser für Fragen zum Katalog als für Fragen zur Kundin oder zum Kunden.
Wiederholungsraten schwanken enorm je nachdem, welche Art von Frage gestellt wird. Ein Positionspapier von 2025 zu kategoriebewusstem semantischem Caching veranschaulicht die Rechnung anhand einer repräsentativen Produktions-Workload: 40 bis 60 Prozent Trefferquote bei Abfragekategorien, die stark wiederkehren. Das ist die Obergrenze der Spanne, mit der das Paper argumentiert, nicht ein gemessener Wert. Seltene oder volatile Kategorien liegen am unteren Ende, bei 5 bis 15 Prozent – das ist die Lücke zwischen einem Cache, der die Infrastruktur um ihn herum finanziert, und einem, der es nicht tut. Das untersuchte Material stammte aus Code und Konversation, nicht aus dem Handel, die Analogie muss also gezogen, nicht vorausgesetzt werden. Die entscheidende Eigenschaft überträgt sich jedoch sauber: Vorlagenhafte Fragen bündeln sich und kehren wieder, offene Fragen streuen.
Unterhalb einer bestimmten Trefferquote kostet das Cachen einer Frage mehr, als sie kalt zu beantworten. Dieselbe illustrative Workload setzt den Break-even für einen konventionellen Vektordatenbank-Cache bei einer Trefferquote von 15 bis 20 Prozent an, weil die Suche bei jedem Fehltreffer läuft und aus den Treffern querfinanziert werden muss. Unterhalb dieser Linie ist die Infrastruktur ein Kostenzentrum im Rabattkleid. Nach der eigenen Darstellung des Papers bleiben damit 20 bis 30 Prozent des Produktions-Traffics per Design vom Cache ausgeschlossen. Die ausgeschlossenen Fragen sind nicht unwichtig. Sie sind unwiederholt, und unwiederholt ist die eine Eigenschaft, die kein Rabatt einpreisen kann.
Ein Cache belohnt nicht die gute Frage, er belohnt dieselbe Frage.
Amazon hat das Routing gebaut, das diese Rechnung nahelegt, und es öffentlich beschrieben. Die Ingenieur:innen des Unternehmens erklärten, wie Rufus ausgeliefert wurde, und teilten den Traffic in zwei Bahnen: “Wie viel Watt hat dieser Akkuschrauber?” geht an kleinere, schnellere Modelle, während die Planung eines Campingausflugs oder die Wahl eines Geschenks tieferes Reasoning und mehrstufigen Dialog verdient. Prompt-Caching taucht in derselben Passage auf wie paralleles Tool-Calling, einsortiert unter Latenz. Der Assistent selbst wurde im Mai in Alexa integriert, wie wir damals berichteten, doch die technische Offenlegung hat das Produkt überlebt. Sie ist die klarste öffentliche Formulierung der Regel: Die Form der Frage entscheidet, welches Modell antwortet – und damit, was die Antwort kostet.
Was als Wiederverwendung zählt, ist enger gefasst, als das Wort vermuten lässt. Ein im Juli auf arXiv veröffentlichtes und diesen Monat überarbeitetes Caching-Framework wandelt Reasoning-Programme in parametrisierte Objekte um, basierend auf der Beobachtung, dass viele Anfragen “ähnliche rechnerische Strukturen teilen, sich aber in den Variablen unterscheiden”; es berichtet von bis zu etwa dreifachem Latenzgewinn bei Anfragesets, die den Shopping-Benchmark WebShop einschließen. Die wiederverwendete Einheit ist die Struktur der Anfrage, mit ausgetauschten Details. ASOS brachte im Mai seine Stylist-App innerhalb von ChatGPT heraus, und der Beispielprompt in der eigenen Ankündigung lautete “zeig mir pastellfarbene A-Linien-Kleider mit Blumenmuster für den Frühling”. Farbe, Muster, Silhouette, Saison: vier Slots und ein Lookup, ein Katalogfilter im Gewand eines Stilgesprächs – und der cacht wunderbar.
Die Anfrage, die sich nicht in Slots zerlegen lässt, ist genau die, die Kund:innen laut eigener Aussage wollen. Asos’ eigene Umfrage, heute Morgen hier berichtet, ergab, dass britische Verbraucher:innen von Händlern eher Stilberatung erwarten als ein größeres Sortiment. Beratung ist per Konstruktion unwiederholbar, weil sie durch die Person definiert wird, die sie erbittet. Es ist zudem, wenig überraschend, genau die Frage, mit der die meisten Anbieter-Demos beginnen. Die beeindruckende Frage und die teure Frage sind ein und dieselbe.

Die Verträge, die auf dieser Rechnung aufbauen, verschleiern die Varianz, statt sie aufzulösen. Intercom berechnet 0,99 US-Dollar pro gelöster Konversation und stellt einmalig in Rechnung, egal wie viele Fragen die Kundin oder der Kunde darin stellt. Das ist ein Festpreis über einer Kostenbasis, die sich danach verschiebt, welches Modell antwortet und wie viel es schreibt – womit die Marge des Anbieters zu einer stehenden Wette auf den Query-Mix wird. Amazon konnte sich diese Wette leisten, bei einem Durchsatz von drei Millionen Tokens pro Minute während des Prime Day. Ein mittelständischer Händler, der Lösungen pro Einheit einkauft, steht auf der anderen Seite dieser Wette.
Der stärkste Einwand lautet, dass Prefix-Caching sich nicht darum schert, was die Kundin oder der Kunde fragt. Der System-Prompt, die Tool-Definitionen und der Katalogkontext stehen vor jeder Anfrage, sodass die Stilfrage denselben Rabatt bekommt wie die Lagerbestandsabfrage. Ein Händler, der überzeugt ist, dass schwierige Fragen besser konvertieren, sollte bereit sein, für sie mehr zu zahlen. Damit der Einwand trägt, müsste die Konversionsprämie auf unwiederholbare Fragen bei jedem Händler mit ihrer Kostenprämie mithalten – nicht nur bei dem mit dem größten Katalog und einem angeschlossenen Werbegeschäft für die Antwort.
Der Rabatt endet genau dort, wo das gemeinsame Präfix endet. Anthropics Dokumentation legt fest, dass ein Cache-Treffer bis zum Breakpoint hundertprozentig identische Segmente voraussetzt und dass Caching keinen Einfluss auf die Generierung von Output-Tokens hat. Alles danach wird zum vollen Satz abgerechnet: die abgerufenen Produkte, die genannten Einschränkungen der Kundschaft und die gesamte geschriebene Antwort, die über Anthropics aktuelle Modellreihe hinweg zum Fünffachen des Inputs bepreist ist, der sie ausgelöst hat. Eine maßgeschneiderte Stilberatung ist die längste Antwort, die ein Assistent je schreiben wird. Sie ist auch der eine Teil der Transaktion, den noch kein Cache je berührt hat.
Nichts davon macht das Stilgespräch unmöglich. Es macht es zu einem Posten, für den jemand argumentieren muss, und ehrlich bepreist ist es Marketingausgabe statt Support-Automatisierung – was es in ein anderes Budget mit einer anderen Renditeschwelle verschiebt. Die Händler, die es weiter anbieten, werden diejenigen sein, die sich dafür entschieden haben, nachdem sie die Zahl gesehen haben. Die, die aufhören, werden es nicht ankündigen. Bleibt die Kostenfrage unausgesprochen, werden ihre Assistenten einfach immer besser darin, Fragen zum Katalog zu beantworten – denn genau dafür war der Cache immer schon gedacht.