Le classifieur lit tout, tranche ce qui est clair, et ne fait monter que le doute chez mistral-medium. Ici c'est surtout le prix et la manette qui se jouent : sur une question unique, l'écart de vitesse existe, mais il est mince.
Tout au modèle génératif
0,00 s
0,00000 $
0 appels au modèle génératif
—
Le classifieur d'abord
0,00 s
0,00000 $
0 au classifieur, 0 au modèle génératif
—
Zone de doute : 0,30 à 0,70. Sur les 116 demandes figées, 85 % sont tranchées d'emblée et 96/99 de celles-là sont justes.
L'élargir envoie plus de messages au modèle cher, la resserrer laisse passer des erreurs. Le même marché que le curseur, appliqué cette fois à l'architecture.
| Zone | Tranché seul | Juste hors zone |
|---|---|---|
| 0,40 à 0,60 | 92 % | 104/107 |
| 0,30 à 0,70 ← | 85 % | 96/99 |
| 0,20 à 0,80 | 67 % | 77/78 |
| 0,15 à 0,85 | 50 % | 58/58 |
Le modèle génératif répond vrai ou faux. On lui a aussi demandé sa certitude : regardez où elle tombe. Une certitude qui ne descend jamais ne sert à rien comme seuil.
Lancez la passe pour voir.
Face à mistral-small, le classifieur n'est que 20 % moins cher : il n'y aurait rien à montrer côté prix. Face à mistral-medium, treize fois moins cher. Et c'est l'architecture réaliste : on ne met pas un petit modèle derrière une décision qui compte.
Quand, d'où, avec quoi
Tout est mesuré le 20 septembre 2026 depuis Quimper, en France. jev-1.13.0 contre mistral-medium-latest et mistral-small-latest, température 0 et sortie JSON imposée au modèle génératif, connexions gardées ouvertes des deux côtés. Un seul passage, un seul jour.
Ces démos tournent depuis Paris, et c'est un choix
Vercel place ses fonctions à Washington par défaut, et c'est ce qui s'est passé au premier déploiement. Mesuré : le trajet vers l'Oregon y tombe à 60 ms au lieu des 179 depuis la France, pendant que le modèle génératif, dont le calcul est en France, se retrouve à 9 000 km. La démonstration montrait donc l'inverse de ce qu'un utilisateur français constate, et elle flattait le classifieur : sur la même passe, la chaîne à deux étages passait de 0,93 fois le temps de l'autre à 0,51. Les routes sont maintenant épinglées sur Paris. Un visiteur français, un serveur français, un modèle américain : c'est le montage que ces mesures décrivent, et c'est le seul qui dise quelque chose d'utile à une PME d'ici.
Le classifieur est à 9 000 km, et ça se voit dans le chronomètre
api.typesafe.ai répond depuis un serveur AWS en Oregon : 179 ms d'aller-retour réseau mesurés (12 ouvertures de connexion, 179 à 188 ms), payés à chaque appel. api.mistral.ai répond en 14 ms, mais c'est un nœud Cloudflare proche de moi, pas le calcul : la suite du trajet reste invisible. Là où les pages séparent le travail du câble, ce n'est plus une estimation : Jev annonce son propre temps de travail dans chaque réponse, et la part de câble est la soustraction. Ce chiffre vient de lui, pas de moi. Mistral ne publiant pas l'équivalent, on ne peut pas faire la même soustraction de son côté, et les rapports affichés comparent donc deux totaux.
Pas de serveur européen pour Jev
TypeSafe indique que le service est hébergé aux États-Unis et s'appuie sur les clauses contractuelles types pour les transferts depuis l'Europe. Aucune région européenne n'est documentée. Passer par une passerelle (Cloudflare, Netlify) n'y change rien : le calcul repart chez le fournisseur, la passerelle ajoute un saut. Le modèle a été annoncé le 15 septembre 2026, cinq jours avant ces mesures. Une sortie existe déjà, mais elle ne passe pas par Jev : une dizaine de copies libres du même format (Laya, Von, kev…) sont apparues en une semaine et s'hébergent où l'on veut, donc en Europe. Je ne les ai pas mesurées.
L'écart de prix mesure ma prose autant que le modèle
Les 2 083 jetons envoyés à chaque appel sont mes propres définitions de questions, contre 259 pour un prompt compact côté génératif. L'écart de 20 % face à mistral-small vient de là. Resserrer les critères ferait baisser le prix, et pourrait dégrader le jugement : je ne l'ai pas mesuré, donc je ne peux pas le revendiquer.
Les 120 demandes sont fabriquées
Écrites par trois modèles aveugles, interdits de lire le moindre fichier du projet. Elles sont plus propres et plus franches qu'un vrai flux de PME. Les étiquettes viennent de deux lecteurs automatiques, pas d'un chef d'entreprise. Aucune donnée réelle nulle part.
Le seuil honnête est 0,50, pas 0,77
0,50 est choisi d'avance, avant de regarder les résultats : 0 demande prioritaire ratée sur 40 et 7 fausses alertes sur 76. Le seuil de 0,77 qui donne 98 % est le meilleur trouvé après coup sur ce même jeu. Il est flatteur et ne vaut que pour lui.
Le détail complet du protocole et des résultats tient dans deux comptes rendus du dépôt : le jeu de demandes et son arbitrage, et la comparaison avec Mistral.