38,8 %de texte d'invite en moins
C'est la part de texte que le modèle n'a plus à lire en réduction complète. Dans la variante prudente, il s'agit de 14,4 pour cent.
Context Economy v1 · 50 passages · trois scénarios · hors ligne
Benchmark
Trois chiffres figurent sur cette page. Chacun provient d'une série de mesures aux conditions consignées, et chacun porte ces conditions avec lui. Une quatrième affirmation manque volontairement : que les réponses en deviennent meilleures. Cela n'a pas été mesuré, donc cela ne figure pas ici.
38,8 %de texte d'invite en moins
C'est la part de texte que le modèle n'a plus à lire en réduction complète. Dans la variante prudente, il s'agit de 14,4 pour cent.
Context Economy v1 · 50 passages · trois scénarios · hors ligne
19,9 %d'électricité en moins par requête
Sur 50 passages sur 50, la consommation a baissé, sans exception. Une fois déduit le calcul supplémentaire que la réduction coûte elle-même, il reste 13,8 pour cent — 18,9 avec le modèle plus grand.
MeluXina Energy v1 · une seule carte A100 · Luxembourg
0document à risque perdu
En mode sûr, aucun document important pour une question sensible n'a été perdu. Taux de réussite sur les cas à haut risque : 100 pour cent.
Hale Model Bench v0 · trois modèles · aucune erreur à haut risque
Un token est un élément de texte, à peu près une syllabe. Les modèles de langage facturent au token : moins de texte signifie moins de coûts et moins de temps de calcul.
Ce qui a été mesuré, c'est la part de l'invite que l'on peut retirer sans rien perdre. En réduction complète, 38,8 pour cent ; dans la variante prudente, 14,4.
La variante prudente ne réduit que le contexte et laisse chaque instruction en place. Elle économise moins, mais c'est la voie où le moins de choses peuvent mal tourner.
Tokens sur 50 passages
Moins d'électricité
19,9 %
d'énergie en moins à la lecture de la question. Sur 50 passages sur 50, sans exception.
Pour un million de requêtes
| sans réduction | 163 kWh |
| avec réduction complète | 131 kWh |
| économisé | 32 kWh |
Que la lecture économisée économise aussi de l'énergie n'a rien d'évident — c'est pourquoi cela a été mesuré séparément, sur une seule carte graphique au centre de calcul MeluXina, au Luxembourg.
Sur les 50 passages, la consommation a été plus faible. Ce qui est mesuré, c'est la lecture de l'invite, avant que le premier mot de la réponse n'existe : 101 watt-secondes de moins par requête, soit 19,9 pour cent.
La réduction coûte elle-même du temps de calcul. Une fois déduite, il reste 13,8 pour cent d'économie avec le petit modèle, 18,9 avec le grand — où la plage confirmée se situe entre 16,1 et 21,6 pour cent. L'avantage croît avec la taille du modèle, car le calcul supplémentaire reste aussi coûteux.
Les kilowattheures ci-dessus sont extrapolés à partir des mesures, ils ne sont pas mesurés : une valeur par requête, multipliée par un million. Le grand modèle est un 14B ouvert servant de substitut, ce n'est pas une affirmation sur un fournisseur.
Savoir si les réponses deviennent meilleures grâce à la réduction reste ouvert. Le rapport d'essai le dit lui-même : « Un test de qualité des invites réduites fait entièrement défaut — ce benchmark compte des tokens, pas des réponses. »
Ce qui est établi est plus modeste, mais tient : rien ne se perd. Aucun document à risque, aucun passage, aucun fichier qui aurait compté pour une question sensible.
| Série | Ce qu’elle montre | Mesuré |
|---|---|---|
| Context Economy v1 | Quelle part du texte d'invite peut être économisée. Hors ligne, 50 passages, trois scénarios. | 3 août 2026 |
| MeluXina Energy v1 | Si l'économie économise aussi de l'électricité. A100, pilote et passage principal. | 4 août 2026 |
| Frontier Proxy v0 | Ce qui se passe avec des modèles plus grands. 14B comme substitut. | 8 août 2026 |
| Hale Model Bench v0 | Si l'acheminement des questions est fiable. Trois modèles, aucune erreur à haut risque. | 28 juillet 2026 |
| Mot | Ce que cela veut dire |
|---|---|
| Turn | Un passage question-réponse. « 50 turns » signifie : demandé et répondu cinquante fois. |
| Token | Un élément de texte, à peu près une syllabe. L'unité de facturation des modèles de langage. |
| Prompt | Tout ce que le modèle lit avant de répondre : question, instructions, documents. |
| Prefill | La lecture de l'invite. C'est là que naît la consommation mesurée. |
| Watt-seconde | La plus petite quantité d'énergie utilisée ici. 101 Ws, c'est environ une lampe de 10 watts pendant dix secondes — autant est économisé par requête. |
| Kilowattheure | 3,6 millions de watt-secondes. L'unité dans laquelle l'électricité est facturée. C'est pourquoi les grands chiffres sont ici en kWh. |
| 7B, 14B | Taille du modèle en milliards de paramètres. Plus grand signifie en général plus habile et plus cher. |
| Document à risque | Un fichier qui compte pour une question sensible. |