Benchmark

Mesuré, non revendiqué

Trois chiffres figurent sur cette page. Chacun provient d'une série de mesures aux conditions consignées, et chacun porte ces conditions avec lui. Une quatrième affirmation manque volontairement : que les réponses en deviennent meilleures. Cela n'a pas été mesuré, donc cela ne figure pas ici.

38,8 %de texte d'invite en moins

C'est la part de texte que le modèle n'a plus à lire en réduction complète. Dans la variante prudente, il s'agit de 14,4 pour cent.

Context Economy v1 · 50 passages · trois scénarios · hors ligne

19,9 %d'électricité en moins par requête

Sur 50 passages sur 50, la consommation a baissé, sans exception. Une fois déduit le calcul supplémentaire que la réduction coûte elle-même, il reste 13,8 pour cent — 18,9 avec le modèle plus grand.

MeluXina Energy v1 · une seule carte A100 · Luxembourg

0document à risque perdu

En mode sûr, aucun document important pour une question sensible n'a été perdu. Taux de réussite sur les cas à haut risque : 100 pour cent.

Hale Model Bench v0 · trois modèles · aucune erreur à haut risque

Moins de texte, même substance

Un token est un élément de texte, à peu près une syllabe. Les modèles de langage facturent au token : moins de texte signifie moins de coûts et moins de temps de calcul.

Ce qui a été mesuré, c'est la part de l'invite que l'on peut retirer sans rien perdre. En réduction complète, 38,8 pour cent ; dans la variante prudente, 14,4.

La variante prudente ne réduit que le contexte et laisse chaque instruction en place. Elle économise moins, mais c'est la voie où le moins de choses peuvent mal tourner.

Tokens sur 50 passages

consommation d'origine · 496 200

invite complète, sans réduction · 9 924 par passage

réduction prudente · 424 670

−14,4 % · 8 493 par passage

réduction complète · 303 618

−38,8 % · 6 072 par passage

Moins d'électricité

19,9 %

d'énergie en moins à la lecture de la question. Sur 50 passages sur 50, sans exception.

Pour un million de requêtes

sans réduction163 kWh
avec réduction complète131 kWh
économisé32 kWh

Réduire le texte, économiser les ressources

Que la lecture économisée économise aussi de l'énergie n'a rien d'évident — c'est pourquoi cela a été mesuré séparément, sur une seule carte graphique au centre de calcul MeluXina, au Luxembourg.

Sur les 50 passages, la consommation a été plus faible. Ce qui est mesuré, c'est la lecture de l'invite, avant que le premier mot de la réponse n'existe : 101 watt-secondes de moins par requête, soit 19,9 pour cent.

La réduction coûte elle-même du temps de calcul. Une fois déduite, il reste 13,8 pour cent d'économie avec le petit modèle, 18,9 avec le grand — où la plage confirmée se situe entre 16,1 et 21,6 pour cent. L'avantage croît avec la taille du modèle, car le calcul supplémentaire reste aussi coûteux.

Les kilowattheures ci-dessus sont extrapolés à partir des mesures, ils ne sont pas mesurés : une valeur par requête, multipliée par un million. Le grand modèle est un 14B ouvert servant de substitut, ce n'est pas une affirmation sur un fournisseur.

Ce qui n'est pas mesuré

Savoir si les réponses deviennent meilleures grâce à la réduction reste ouvert. Le rapport d'essai le dit lui-même : « Un test de qualité des invites réduites fait entièrement défaut — ce benchmark compte des tokens, pas des réponses. »

Ce qui est établi est plus modeste, mais tient : rien ne se perd. Aucun document à risque, aucun passage, aucun fichier qui aurait compté pour une question sensible.

D'où viennent les chiffres

SérieCe qu’elle montreMesuré
Context Economy v1Quelle part du texte d'invite peut être économisée. Hors ligne, 50 passages, trois scénarios.3 août 2026
MeluXina Energy v1Si l'économie économise aussi de l'électricité. A100, pilote et passage principal.4 août 2026
Frontier Proxy v0Ce qui se passe avec des modèles plus grands. 14B comme substitut.8 août 2026
Hale Model Bench v0Si l'acheminement des questions est fiable. Trois modèles, aucune erreur à haut risque.28 juillet 2026

Les mots employés dans les rapports

MotCe que cela veut dire
TurnUn passage question-réponse. « 50 turns » signifie : demandé et répondu cinquante fois.
TokenUn élément de texte, à peu près une syllabe. L'unité de facturation des modèles de langage.
PromptTout ce que le modèle lit avant de répondre : question, instructions, documents.
PrefillLa lecture de l'invite. C'est là que naît la consommation mesurée.
Watt-secondeLa plus petite quantité d'énergie utilisée ici. 101 Ws, c'est environ une lampe de 10 watts pendant dix secondes — autant est économisé par requête.
Kilowattheure3,6 millions de watt-secondes. L'unité dans laquelle l'électricité est facturée. C'est pourquoi les grands chiffres sont ici en kWh.
7B, 14BTaille du modèle en milliards de paramètres. Plus grand signifie en général plus habile et plus cher.
Document à risqueUn fichier qui compte pour une question sensible.