Benchmark

Gemessen, nicht behauptet

Drei Zahlen stehen auf dieser Seite. Jede stammt aus einer Messreihe mit festgehaltenen Bedingungen, und jede trägt diese Bedingungen mit sich. Eine vierte Aussage fehlt bewusst: dass die Antworten dadurch besser werden. Das ist nicht gemessen worden, also steht es hier nicht.

38,8 %weniger Prompt-Text

So viel Text muss das Modell bei voller Kürzung nicht mehr lesen. In der vorsichtigen Variante sind es 14,4 Prozent.

Kontext-Ökonomie v1 · 50 Durchläufe · drei Szenarien · offline

19,9 %weniger Strom je Anfrage

In 50 von 50 Durchläufen wurde weniger Energie gebraucht, ausnahmslos. Rechnet man die Zusatzrechnung dagegen, die das Kürzen kostet, bleiben 13,8 Prozent — beim größeren Modell 18,9.

MeluXina Energie v1 · eine A100-Grafikkarte · Luxemburg

0verlorene Risiko-Belege

Im sicheren Modus ging kein einziges Dokument verloren, das für eine heikle Frage wichtig war. Trefferquote bei Hochrisiko-Fällen: 100 Prozent.

Hale Model Bench v0 · drei Modelle · keine Hochrisiko-Fehler

Weniger Text, gleiche Substanz

Ein Token ist ein Textbaustein, etwa eine Silbe. Sprachmodelle rechnen pro Token ab: Weniger Text heißt weniger Kosten und weniger Rechenzeit.

Gemessen wurde, wie viel vom Prompt sich streichen lässt, ohne dass etwas verloren geht. In der vollen Kürzung sind es 38,8 Prozent, in der vorsichtigen 14,4.

Die vorsichtige Variante streicht nur den Kontext und lässt jede Anweisung stehen. Sie spart weniger, ist dafür der Weg, bei dem am wenigsten schiefgehen kann.

Token über 50 Durchläufe

Original-Tokenverbrauch · 496.200

voller Prompt, ohne Kürzung · 9.924 je Durchlauf

vorsichtig gekürzt · 424.670

−14,4 % · 8.493 je Durchlauf

voll gekürzt · 303.618

−38,8 % · 6.072 je Durchlauf

Weniger Strom

19,9 %

weniger Energie beim Einlesen der Frage. In 50 von 50 Durchläufen, ausnahmslos.

Bei einer Million Anfragen

ohne Kürzung163 kWh
mit voller Kürzung131 kWh
gespart32 kWh

Text kürzen – Ressourcen sparen

Dass gespartes Lesen auch Energie spart, ist keine Selbstverständlichkeit — deshalb wurde es getrennt gemessen, auf einer einzelnen Grafikkarte im luxemburgischen Rechenzentrum MeluXina.

In allen 50 Durchläufen lag der Verbrauch niedriger. Gemessen wird das Einlesen des Prompts, bevor das erste Wort der Antwort entsteht: 101 Wattsekunden weniger je Anfrage, das sind 19,9 Prozent.

Das Kürzen kostet selbst Rechenzeit. Zieht man sie ab, bleiben beim kleinen Modell 13,8 Prozent Ersparnis, beim großen 18,9 — dort liegt der gesicherte Bereich zwischen 16,1 und 21,6 Prozent. Der Vorteil wächst mit der Modellgröße, weil die Zusatzrechnung gleich teuer bleibt.

Die Kilowattstunden oben sind aus den Messwerten hochgerechnet, nicht gemessen: ein Wert je Anfrage, mal eine Million. Das große Modell ist ein offenes 14B als Stellvertreter, keine Aussage über andere Anbieter.

Was nicht gemessen ist

Ob die Antworten durch die Kürzung besser werden, ist offen. Der Versuchsbericht sagt es selbst: „Ein Qualitätstest der gekürzten Prompts fehlt vollständig — dieser Benchmark zählt Token, nicht Antworten."

Belegt ist etwas Kleineres, das dafür hält: Es geht nichts verloren. Kein Risiko-Beleg, keine Fundstelle, kein Dokument, das für eine heikle Frage wichtig gewesen wäre.

Woher die Zahlen stammen

MessreiheWas sie zeigtGemessen
Kontext-Ökonomie v1Wie viel Prompt-Text sich einsparen lässt. Offline, 50 Durchläufe, drei Szenarien.3. August 2026
MeluXina Energie v1Ob die Ersparnis auch Strom spart. A100, Pilot- und Hauptlauf.4. August 2026
Frontier Proxy v0Was mit größeren Modellen passiert. 14B als Stellvertreter.8. August 2026
Hale Model Bench v0Ob die Weiterleitung von Fragen zuverlässig ist. Drei Modelle, keine Hochrisiko-Fehler.28. Juli 2026

Begriffe und ihre Bedeutung

WortWas es heißt
TurnEin Frage-Antwort-Durchlauf. „50 Turns" heißt: fünfzig Mal gefragt und geantwortet.
TokenEin Textbaustein, etwa eine Silbe. Die Abrechnungseinheit von Sprachmodellen.
PromptAlles, was das Modell vor der Antwort liest: Frage, Anweisungen, Dokumente.
PrefillDas Einlesen des Prompts. Hier entsteht der gemessene Stromverbrauch.
WattsekundeDie kleinste hier genutzte Energiemenge. 101 Ws sind etwa eine 10-Watt-Lampe für zehn Sekunden — so viel wird je Anfrage gespart.
Kilowattstunde3,6 Millionen Wattsekunden. Die Einheit, in der Strom abgerechnet wird. Deshalb stehen die großen Zahlen hier in kWh.
7B, 14BModellgröße in Milliarden Parametern. Größer heißt meist klüger und teurer.
Risiko-BelegEin Dokument, das für eine heikle Frage wichtig ist.