38,8 %weniger Prompt-Text
So viel Text muss das Modell bei voller Kürzung nicht mehr lesen. In der vorsichtigen Variante sind es 14,4 Prozent.
Kontext-Ökonomie v1 · 50 Durchläufe · drei Szenarien · offline
Benchmark
Drei Zahlen stehen auf dieser Seite. Jede stammt aus einer Messreihe mit festgehaltenen Bedingungen, und jede trägt diese Bedingungen mit sich. Eine vierte Aussage fehlt bewusst: dass die Antworten dadurch besser werden. Das ist nicht gemessen worden, also steht es hier nicht.
38,8 %weniger Prompt-Text
So viel Text muss das Modell bei voller Kürzung nicht mehr lesen. In der vorsichtigen Variante sind es 14,4 Prozent.
Kontext-Ökonomie v1 · 50 Durchläufe · drei Szenarien · offline
19,9 %weniger Strom je Anfrage
In 50 von 50 Durchläufen wurde weniger Energie gebraucht, ausnahmslos. Rechnet man die Zusatzrechnung dagegen, die das Kürzen kostet, bleiben 13,8 Prozent — beim größeren Modell 18,9.
MeluXina Energie v1 · eine A100-Grafikkarte · Luxemburg
0verlorene Risiko-Belege
Im sicheren Modus ging kein einziges Dokument verloren, das für eine heikle Frage wichtig war. Trefferquote bei Hochrisiko-Fällen: 100 Prozent.
Hale Model Bench v0 · drei Modelle · keine Hochrisiko-Fehler
Ein Token ist ein Textbaustein, etwa eine Silbe. Sprachmodelle rechnen pro Token ab: Weniger Text heißt weniger Kosten und weniger Rechenzeit.
Gemessen wurde, wie viel vom Prompt sich streichen lässt, ohne dass etwas verloren geht. In der vollen Kürzung sind es 38,8 Prozent, in der vorsichtigen 14,4.
Die vorsichtige Variante streicht nur den Kontext und lässt jede Anweisung stehen. Sie spart weniger, ist dafür der Weg, bei dem am wenigsten schiefgehen kann.
Token über 50 Durchläufe
Weniger Strom
19,9 %
weniger Energie beim Einlesen der Frage. In 50 von 50 Durchläufen, ausnahmslos.
Bei einer Million Anfragen
| ohne Kürzung | 163 kWh |
| mit voller Kürzung | 131 kWh |
| gespart | 32 kWh |
Dass gespartes Lesen auch Energie spart, ist keine Selbstverständlichkeit — deshalb wurde es getrennt gemessen, auf einer einzelnen Grafikkarte im luxemburgischen Rechenzentrum MeluXina.
In allen 50 Durchläufen lag der Verbrauch niedriger. Gemessen wird das Einlesen des Prompts, bevor das erste Wort der Antwort entsteht: 101 Wattsekunden weniger je Anfrage, das sind 19,9 Prozent.
Das Kürzen kostet selbst Rechenzeit. Zieht man sie ab, bleiben beim kleinen Modell 13,8 Prozent Ersparnis, beim großen 18,9 — dort liegt der gesicherte Bereich zwischen 16,1 und 21,6 Prozent. Der Vorteil wächst mit der Modellgröße, weil die Zusatzrechnung gleich teuer bleibt.
Die Kilowattstunden oben sind aus den Messwerten hochgerechnet, nicht gemessen: ein Wert je Anfrage, mal eine Million. Das große Modell ist ein offenes 14B als Stellvertreter, keine Aussage über andere Anbieter.
Ob die Antworten durch die Kürzung besser werden, ist offen. Der Versuchsbericht sagt es selbst: „Ein Qualitätstest der gekürzten Prompts fehlt vollständig — dieser Benchmark zählt Token, nicht Antworten."
Belegt ist etwas Kleineres, das dafür hält: Es geht nichts verloren. Kein Risiko-Beleg, keine Fundstelle, kein Dokument, das für eine heikle Frage wichtig gewesen wäre.
| Messreihe | Was sie zeigt | Gemessen |
|---|---|---|
| Kontext-Ökonomie v1 | Wie viel Prompt-Text sich einsparen lässt. Offline, 50 Durchläufe, drei Szenarien. | 3. August 2026 |
| MeluXina Energie v1 | Ob die Ersparnis auch Strom spart. A100, Pilot- und Hauptlauf. | 4. August 2026 |
| Frontier Proxy v0 | Was mit größeren Modellen passiert. 14B als Stellvertreter. | 8. August 2026 |
| Hale Model Bench v0 | Ob die Weiterleitung von Fragen zuverlässig ist. Drei Modelle, keine Hochrisiko-Fehler. | 28. Juli 2026 |
| Wort | Was es heißt |
|---|---|
| Turn | Ein Frage-Antwort-Durchlauf. „50 Turns" heißt: fünfzig Mal gefragt und geantwortet. |
| Token | Ein Textbaustein, etwa eine Silbe. Die Abrechnungseinheit von Sprachmodellen. |
| Prompt | Alles, was das Modell vor der Antwort liest: Frage, Anweisungen, Dokumente. |
| Prefill | Das Einlesen des Prompts. Hier entsteht der gemessene Stromverbrauch. |
| Wattsekunde | Die kleinste hier genutzte Energiemenge. 101 Ws sind etwa eine 10-Watt-Lampe für zehn Sekunden — so viel wird je Anfrage gespart. |
| Kilowattstunde | 3,6 Millionen Wattsekunden. Die Einheit, in der Strom abgerechnet wird. Deshalb stehen die großen Zahlen hier in kWh. |
| 7B, 14B | Modellgröße in Milliarden Parametern. Größer heißt meist klüger und teurer. |
| Risiko-Beleg | Ein Dokument, das für eine heikle Frage wichtig ist. |