Le 15 septembre, TypeSafe a sorti Jev : un modèle qui ne rédige rien, répond à des questions fermées et rend une probabilité. En cinq jours, une dizaine de copies libres sont apparues. J'ai passé les briques de classification d'un projet réel dedans, puis comparé à un modèle génératif sur la même tâche. Voici ce que ça donne, y compris ce qui ne flatte pas le classifieur.
| Modèle | Nature | Latence | Coût par appel | Demandes pour 1 $ |
|---|---|---|---|---|
| Jev (jev-1.13.0) | classifieur | 295 ms | 0,000087 $ | 11 400 |
| Mistral Small | génératif, petit | 718 ms | 0,000104 $ | 9 600 |
| Mistral Medium | génératif, qualité | 734 ms | 0,001109 $ | 900 |
Mesuré le 20 septembre 2026, six appels par modèle. Ces temps valent pour onze champs à remplir : sur une seule question, c'est match nul, 308 ms contre 342. Le protocole complet et ce qui joue contre ces chiffres sont en bas de page.
ça dépend
Sur onze champs, 2,4 fois : la frontière entre une analyse qui suit la frappe et une qui traîne. Sur une seule question, match nul. Deux causes : le génératif n'a qu'un mot à écrire, et le classifieur paie 179 ms d'aller-retour jusqu'à l'Oregon.
ça tient
Le modèle génératif répond vrai ou faux. Le classifieur répond 0,86. Un seuil, une zone de doute, une manette : rien de tout ça n'existe avec une étiquette.
ça tombe
20 % d'écart, pas vingt fois. Les définitions des questions pèsent 2 083 jetons à chaque appel là où un prompt compact en pèse 259.
ça tient
Treize fois moins cher. C'est la comparaison qui compte quand la décision a un enjeu.
Onze questions posées pendant que vous tapez, dans un seul appel.
Ce que ça prouve : Ce que la latence permet : une analyse qui suit la frappe.
Un seuil qu'on déplace, les cas ratés et les fausses alertes qui s'échangent.
Ce que ça prouve : Ce qu'un nombre permet et qu'une étiquette interdit.
Le classifieur tranche le gros du flux, le modèle de qualité ne voit que le doute.
Ce que ça prouve : Là où l'économie est réelle, et là où elle ne l'est pas.
Ce que je ne prétends pas : qu'un classifieur remplace un modèle génératif. Il ne rédige rien, il lit au pied de la lettre, et sur les deux gardes à enjeu du projet réel il n'a pas tenu les exigences fixées d'avance. La troisième démo montre l'arrangement qui en découle.
Quand, d'où, avec quoi
Tout est mesuré le 20 septembre 2026 depuis Quimper, en France. jev-1.13.0 contre mistral-medium-latest et mistral-small-latest, température 0 et sortie JSON imposée au modèle génératif, connexions gardées ouvertes des deux côtés. Un seul passage, un seul jour.
Ces démos tournent depuis Paris, et c'est un choix
Vercel place ses fonctions à Washington par défaut, et c'est ce qui s'est passé au premier déploiement. Mesuré : le trajet vers l'Oregon y tombe à 60 ms au lieu des 179 depuis la France, pendant que le modèle génératif, dont le calcul est en France, se retrouve à 9 000 km. La démonstration montrait donc l'inverse de ce qu'un utilisateur français constate, et elle flattait le classifieur : sur la même passe, la chaîne à deux étages passait de 0,93 fois le temps de l'autre à 0,51. Les routes sont maintenant épinglées sur Paris. Un visiteur français, un serveur français, un modèle américain : c'est le montage que ces mesures décrivent, et c'est le seul qui dise quelque chose d'utile à une PME d'ici.
Le classifieur est à 9 000 km, et ça se voit dans le chronomètre
api.typesafe.ai répond depuis un serveur AWS en Oregon : 179 ms d'aller-retour réseau mesurés (12 ouvertures de connexion, 179 à 188 ms), payés à chaque appel. api.mistral.ai répond en 14 ms, mais c'est un nœud Cloudflare proche de moi, pas le calcul : la suite du trajet reste invisible. Là où les pages séparent le travail du câble, ce n'est plus une estimation : Jev annonce son propre temps de travail dans chaque réponse, et la part de câble est la soustraction. Ce chiffre vient de lui, pas de moi. Mistral ne publiant pas l'équivalent, on ne peut pas faire la même soustraction de son côté, et les rapports affichés comparent donc deux totaux.
Pas de serveur européen pour Jev
TypeSafe indique que le service est hébergé aux États-Unis et s'appuie sur les clauses contractuelles types pour les transferts depuis l'Europe. Aucune région européenne n'est documentée. Passer par une passerelle (Cloudflare, Netlify) n'y change rien : le calcul repart chez le fournisseur, la passerelle ajoute un saut. Le modèle a été annoncé le 15 septembre 2026, cinq jours avant ces mesures. Une sortie existe déjà, mais elle ne passe pas par Jev : une dizaine de copies libres du même format (Laya, Von, kev…) sont apparues en une semaine et s'hébergent où l'on veut, donc en Europe. Je ne les ai pas mesurées.
L'écart de prix mesure ma prose autant que le modèle
Les 2 083 jetons envoyés à chaque appel sont mes propres définitions de questions, contre 259 pour un prompt compact côté génératif. L'écart de 20 % face à mistral-small vient de là. Resserrer les critères ferait baisser le prix, et pourrait dégrader le jugement : je ne l'ai pas mesuré, donc je ne peux pas le revendiquer.
Les 120 demandes sont fabriquées
Écrites par trois modèles aveugles, interdits de lire le moindre fichier du projet. Elles sont plus propres et plus franches qu'un vrai flux de PME. Les étiquettes viennent de deux lecteurs automatiques, pas d'un chef d'entreprise. Aucune donnée réelle nulle part.
Le seuil honnête est 0,50, pas 0,77
0,50 est choisi d'avance, avant de regarder les résultats : 0 demande prioritaire ratée sur 40 et 7 fausses alertes sur 76. Le seuil de 0,77 qui donne 98 % est le meilleur trouvé après coup sur ce même jeu. Il est flatteur et ne vaut que pour lui.
Le détail complet du protocole et des résultats tient dans deux comptes rendus du dépôt : le jeu de demandes et son arbitrage, et la comparaison avec Mistral.