Les deux étages

Le classifieur lit tout, tranche ce qui est clair, et ne fait monter que le doute chez mistral-medium. Ici c'est surtout le prix et la manette qui se jouent : sur une question unique, l'écart de vitesse existe, mais il est mince.

Tout au modèle génératif

0,00 s

0,00000 $

0 appels au modèle génératif

Le classifieur d'abord

0,00 s

0,00000 $

0 au classifieur, 0 au modèle génératif

Lancez la passe : les deux compteurs se remplissent en direct, appel après appel.

Zone de doute : 0,30 à 0,70. Sur les 116 demandes figées, 85 % sont tranchées d'emblée et 96/99 de celles-là sont justes.

La demandeJevCe qu'il advient

La largeur de la zone est une manette

L'élargir envoie plus de messages au modèle cher, la resserrer laisse passer des erreurs. Le même marché que le curseur, appliqué cette fois à l'architecture.

ZoneTranché seulJuste hors zone
0,40 à 0,6092 %104/107
0,30 à 0,7085 %96/99
0,20 à 0,8067 %77/78
0,15 à 0,8550 %58/58

Ce que le second étage rend, et ce qu'il ne rend pas

Le modèle génératif répond vrai ou faux. On lui a aussi demandé sa certitude : regardez où elle tombe. Une certitude qui ne descend jamais ne sert à rien comme seuil.

Lancez la passe pour voir.

Pourquoi le modèle de qualité, et pas le petit

Face à mistral-small, le classifieur n'est que 20 % moins cher : il n'y aurait rien à montrer côté prix. Face à mistral-medium, treize fois moins cher. Et c'est l'architecture réaliste : on ne met pas un petit modèle derrière une décision qui compte.

Ce que cette démo admet

  • Sur cette tâche, le classifieur n'est pas meilleur, et à peine plus rapide : une seule question à poser, le modèle génératif n'a qu'un mot à écrire. Mesuré dix fois depuis Paris, 237 ms de médiane contre 373.
  • L'écart de vitesse revient dès qu'il y a des champs à remplir : sur onze champs, 293 ms contre 634. C'est la démo du formulaire qui porte cet argument.
  • Les gains affichés supposent que la plupart des cas tombent hors de la zone de doute. Sur un flux plus ambigu, l'avantage fond.
  • Les douze demandes sont fabriquées pour la démonstration.

Comment c'est mesuré

  • Les deux appels partent du même serveur, connexion ouverte dès l'arrivée sur la page. Sans ça, le premier chronomètre mesurerait une poignée de main chiffrée de 380 à 440 ms.
  • Le modèle génératif est appelé une seule fois par message ; son temps est compté dans les deux chaînes quand les deux en ont besoin.
  • Tarifs relevés le 20 septembre 2026 : 1,50 $ et 7,50 $ le million de jetons pour mistral-medium, 0,042 $ en entrée pour Jev, sortie gratuite.
  • Plafond par visiteur : 30 appels au modèle génératif par minute, 150 par heure.
Conditions de la mesure, et ce qui joue contre ces chiffres

Quand, d'où, avec quoi

Tout est mesuré le 20 septembre 2026 depuis Quimper, en France. jev-1.13.0 contre mistral-medium-latest et mistral-small-latest, température 0 et sortie JSON imposée au modèle génératif, connexions gardées ouvertes des deux côtés. Un seul passage, un seul jour.

Ces démos tournent depuis Paris, et c'est un choix

Vercel place ses fonctions à Washington par défaut, et c'est ce qui s'est passé au premier déploiement. Mesuré : le trajet vers l'Oregon y tombe à 60 ms au lieu des 179 depuis la France, pendant que le modèle génératif, dont le calcul est en France, se retrouve à 9 000 km. La démonstration montrait donc l'inverse de ce qu'un utilisateur français constate, et elle flattait le classifieur : sur la même passe, la chaîne à deux étages passait de 0,93 fois le temps de l'autre à 0,51. Les routes sont maintenant épinglées sur Paris. Un visiteur français, un serveur français, un modèle américain : c'est le montage que ces mesures décrivent, et c'est le seul qui dise quelque chose d'utile à une PME d'ici.

Le classifieur est à 9 000 km, et ça se voit dans le chronomètre

api.typesafe.ai répond depuis un serveur AWS en Oregon : 179 ms d'aller-retour réseau mesurés (12 ouvertures de connexion, 179 à 188 ms), payés à chaque appel. api.mistral.ai répond en 14 ms, mais c'est un nœud Cloudflare proche de moi, pas le calcul : la suite du trajet reste invisible. Là où les pages séparent le travail du câble, ce n'est plus une estimation : Jev annonce son propre temps de travail dans chaque réponse, et la part de câble est la soustraction. Ce chiffre vient de lui, pas de moi. Mistral ne publiant pas l'équivalent, on ne peut pas faire la même soustraction de son côté, et les rapports affichés comparent donc deux totaux.

Pas de serveur européen pour Jev

TypeSafe indique que le service est hébergé aux États-Unis et s'appuie sur les clauses contractuelles types pour les transferts depuis l'Europe. Aucune région européenne n'est documentée. Passer par une passerelle (Cloudflare, Netlify) n'y change rien : le calcul repart chez le fournisseur, la passerelle ajoute un saut. Le modèle a été annoncé le 15 septembre 2026, cinq jours avant ces mesures. Une sortie existe déjà, mais elle ne passe pas par Jev : une dizaine de copies libres du même format (Laya, Von, kev…) sont apparues en une semaine et s'hébergent où l'on veut, donc en Europe. Je ne les ai pas mesurées.

L'écart de prix mesure ma prose autant que le modèle

Les 2 083 jetons envoyés à chaque appel sont mes propres définitions de questions, contre 259 pour un prompt compact côté génératif. L'écart de 20 % face à mistral-small vient de là. Resserrer les critères ferait baisser le prix, et pourrait dégrader le jugement : je ne l'ai pas mesuré, donc je ne peux pas le revendiquer.

Les 120 demandes sont fabriquées

Écrites par trois modèles aveugles, interdits de lire le moindre fichier du projet. Elles sont plus propres et plus franches qu'un vrai flux de PME. Les étiquettes viennent de deux lecteurs automatiques, pas d'un chef d'entreprise. Aucune donnée réelle nulle part.

Le seuil honnête est 0,50, pas 0,77

0,50 est choisi d'avance, avant de regarder les résultats : 0 demande prioritaire ratée sur 40 et 7 fausses alertes sur 76. Le seuil de 0,77 qui donne 98 % est le meilleur trouvé après coup sur ce même jeu. Il est flatteur et ne vaut que pour lui.

Le détail complet du protocole et des résultats tient dans deux comptes rendus du dépôt : le jeu de demandes et son arbitrage, et la comparaison avec Mistral.