Un classifieur qui répond en 300 ms : ce que j'ai mesuré

Le 15 septembre, TypeSafe a sorti Jev : un modèle qui ne rédige rien, répond à des questions fermées et rend une probabilité. En cinq jours, une dizaine de copies libres sont apparues. J'ai passé les briques de classification d'un projet réel dedans, puis comparé à un modèle génératif sur la même tâche. Voici ce que ça donne, y compris ce qui ne flatte pas le classifieur.

Même demande, onze champs à remplir, connexion ouverte des deux côtés

ModèleNatureLatenceCoût par appelDemandes pour 1 $
Jev (jev-1.13.0)classifieur295 ms0,000087 $11 400
Mistral Smallgénératif, petit718 ms0,000104 $9 600
Mistral Mediumgénératif, qualité734 ms0,001109 $900

Mesuré le 20 septembre 2026, six appels par modèle. Ces temps valent pour onze champs à remplir : sur une seule question, c'est match nul, 308 ms contre 342. Le protocole complet et ce qui joue contre ces chiffres sont en bas de page.

ça dépend

La latence, selon le nombre de champs

Sur onze champs, 2,4 fois : la frontière entre une analyse qui suit la frappe et une qui traîne. Sur une seule question, match nul. Deux causes : le génératif n'a qu'un mot à écrire, et le classifieur paie 179 ms d'aller-retour jusqu'à l'Oregon.

ça tient

Un nombre, pas une étiquette

Le modèle génératif répond vrai ou faux. Le classifieur répond 0,86. Un seuil, une zone de doute, une manette : rien de tout ça n'existe avec une étiquette.

ça tombe

Le coût, face à un petit modèle

20 % d'écart, pas vingt fois. Les définitions des questions pèsent 2 083 jetons à chaque appel là où un prompt compact en pèse 259.

ça tient

Le coût, face à un modèle de qualité

Treize fois moins cher. C'est la comparaison qui compte quand la décision a un enjeu.

Trois démos, pour voir plutôt que pour croire

Ce que je ne prétends pas : qu'un classifieur remplace un modèle génératif. Il ne rédige rien, il lit au pied de la lettre, et sur les deux gardes à enjeu du projet réel il n'a pas tenu les exigences fixées d'avance. La troisième démo montre l'arrangement qui en découle.

Conditions de la mesure, et ce qui joue contre ces chiffres

Quand, d'où, avec quoi

Tout est mesuré le 20 septembre 2026 depuis Quimper, en France. jev-1.13.0 contre mistral-medium-latest et mistral-small-latest, température 0 et sortie JSON imposée au modèle génératif, connexions gardées ouvertes des deux côtés. Un seul passage, un seul jour.

Ces démos tournent depuis Paris, et c'est un choix

Vercel place ses fonctions à Washington par défaut, et c'est ce qui s'est passé au premier déploiement. Mesuré : le trajet vers l'Oregon y tombe à 60 ms au lieu des 179 depuis la France, pendant que le modèle génératif, dont le calcul est en France, se retrouve à 9 000 km. La démonstration montrait donc l'inverse de ce qu'un utilisateur français constate, et elle flattait le classifieur : sur la même passe, la chaîne à deux étages passait de 0,93 fois le temps de l'autre à 0,51. Les routes sont maintenant épinglées sur Paris. Un visiteur français, un serveur français, un modèle américain : c'est le montage que ces mesures décrivent, et c'est le seul qui dise quelque chose d'utile à une PME d'ici.

Le classifieur est à 9 000 km, et ça se voit dans le chronomètre

api.typesafe.ai répond depuis un serveur AWS en Oregon : 179 ms d'aller-retour réseau mesurés (12 ouvertures de connexion, 179 à 188 ms), payés à chaque appel. api.mistral.ai répond en 14 ms, mais c'est un nœud Cloudflare proche de moi, pas le calcul : la suite du trajet reste invisible. Là où les pages séparent le travail du câble, ce n'est plus une estimation : Jev annonce son propre temps de travail dans chaque réponse, et la part de câble est la soustraction. Ce chiffre vient de lui, pas de moi. Mistral ne publiant pas l'équivalent, on ne peut pas faire la même soustraction de son côté, et les rapports affichés comparent donc deux totaux.

Pas de serveur européen pour Jev

TypeSafe indique que le service est hébergé aux États-Unis et s'appuie sur les clauses contractuelles types pour les transferts depuis l'Europe. Aucune région européenne n'est documentée. Passer par une passerelle (Cloudflare, Netlify) n'y change rien : le calcul repart chez le fournisseur, la passerelle ajoute un saut. Le modèle a été annoncé le 15 septembre 2026, cinq jours avant ces mesures. Une sortie existe déjà, mais elle ne passe pas par Jev : une dizaine de copies libres du même format (Laya, Von, kev…) sont apparues en une semaine et s'hébergent où l'on veut, donc en Europe. Je ne les ai pas mesurées.

L'écart de prix mesure ma prose autant que le modèle

Les 2 083 jetons envoyés à chaque appel sont mes propres définitions de questions, contre 259 pour un prompt compact côté génératif. L'écart de 20 % face à mistral-small vient de là. Resserrer les critères ferait baisser le prix, et pourrait dégrader le jugement : je ne l'ai pas mesuré, donc je ne peux pas le revendiquer.

Les 120 demandes sont fabriquées

Écrites par trois modèles aveugles, interdits de lire le moindre fichier du projet. Elles sont plus propres et plus franches qu'un vrai flux de PME. Les étiquettes viennent de deux lecteurs automatiques, pas d'un chef d'entreprise. Aucune donnée réelle nulle part.

Le seuil honnête est 0,50, pas 0,77

0,50 est choisi d'avance, avant de regarder les résultats : 0 demande prioritaire ratée sur 40 et 7 fausses alertes sur 76. Le seuil de 0,77 qui donne 98 % est le meilleur trouvé après coup sur ce même jeu. Il est flatteur et ne vaut que pour lui.

Le détail complet du protocole et des résultats tient dans deux comptes rendus du dépôt : le jeu de demandes et son arbitrage, et la comparaison avec Mistral.