Le curseur

120 demandes, une question : faut-il qu'un humain s'en occupe aujourd'hui ? Déplacez le seuil.

Le passage entier

35,5 s

120 demandes, une seule fois

Ce qu'il a coûté

0,0051 $

121 731 jetons

Par demande

288 ms

de 227 à 508 ms

40 demandes vraiment prioritairesà gauche du seuil : ratées

0 — peut attendre1 — à traiter aujourd'hui

76 demandes qui peuvent attendreà droite du seuil : dérangées pour rien

Au seuil 0,50, vous laissez passer 0 demande prioritaire sur 40 et vous dérangez 7 personnes pour rien sur 76.

Soit 109 demandes sur 116 du bon côté, 94 %. Ces 120 demandes sont fabriquées pour la démonstration : la mécanique est vraie, les messages n'appartiennent à personne.

La règle appliquée

On pose la question au classifieur et on prend sa probabilité telle quelle. C'est la règle qui gagne sur ce jeu, et ce n'était pas joué d'avance.

Le résultat qui surprend : ici, la question seule bat les deux règles combinées. Sur les bancs réels du 19 septembre, c'était l'inverse, et de dix points. La bonne règle ne se devine pas, elle se mesure sur ses propres données.

Et le seuil le plus avantageux se trouve en essayant tous les seuils sur ce même jeu : il est donc flatteur. Sur des demandes qu'on n'a pas vues, il tiendra moins bien. 4 cas sont écartés du décompte : les deux lecteurs ne s'y accordaient pas.

Ce qu'une étiquette ne donne pas

Un modèle génératif répond « prioritaire » ou « peut attendre ». Pas de seuil, pas de curseur, rien à régler. Mesuré sur les mêmes messages : sa certitude déclarée tenait sur sept valeurs, toutes au-dessus de 0,85. Inutilisable comme réglage.

Où tombent les 120 probabilités

0,00,14

0,10,353

0,30,720

0,70,914

0,91,029

Comment ces 120 demandes ont été faites

  • Trois agents les ont écrites sans jamais lire les questions posées au classifieur.
  • Les identifiants ont été attribués après brouillage : ils ne disent pas la réponse.
  • Un quatrième lecteur, aveugle lui aussi, a réétiqueté les 120 messages mélangés.
  • Les 4 désaccords sortent du décompte au lieu d'être comptés comme des erreurs.

Les quatre questions posées

  • Réponse humaine aujourd'hui (la principale)
  • L'activité est à l'arrêt
  • Échéance à un ou deux jours
  • A déjà écrit sans réponse

Les trois questions factuelles ne coûtent presque rien de plus : ajouter des questions à un classifieur se paie en millisecondes, pas en secondes.

Ce que la démo ne cache pas

  • Les messages sont fabriqués. Un jeu réel serait plus sale et les chiffres moins beaux.
  • Les étiquettes viennent de deux lecteurs automatiques, pas d'un chef d'entreprise.
  • Le seuil qui marche ici ne marche pas ailleurs : il se règle sur ses propres données.
  • Passage du 20/09/2026, modèle jev-1.13.0.
Conditions de la mesure, et ce qui joue contre ces chiffres

Quand, d'où, avec quoi

Tout est mesuré le 20 septembre 2026 depuis Quimper, en France. jev-1.13.0 contre mistral-medium-latest et mistral-small-latest, température 0 et sortie JSON imposée au modèle génératif, connexions gardées ouvertes des deux côtés. Un seul passage, un seul jour.

Ces démos tournent depuis Paris, et c'est un choix

Vercel place ses fonctions à Washington par défaut, et c'est ce qui s'est passé au premier déploiement. Mesuré : le trajet vers l'Oregon y tombe à 60 ms au lieu des 179 depuis la France, pendant que le modèle génératif, dont le calcul est en France, se retrouve à 9 000 km. La démonstration montrait donc l'inverse de ce qu'un utilisateur français constate, et elle flattait le classifieur : sur la même passe, la chaîne à deux étages passait de 0,93 fois le temps de l'autre à 0,51. Les routes sont maintenant épinglées sur Paris. Un visiteur français, un serveur français, un modèle américain : c'est le montage que ces mesures décrivent, et c'est le seul qui dise quelque chose d'utile à une PME d'ici.

Le classifieur est à 9 000 km, et ça se voit dans le chronomètre

api.typesafe.ai répond depuis un serveur AWS en Oregon : 179 ms d'aller-retour réseau mesurés (12 ouvertures de connexion, 179 à 188 ms), payés à chaque appel. api.mistral.ai répond en 14 ms, mais c'est un nœud Cloudflare proche de moi, pas le calcul : la suite du trajet reste invisible. Là où les pages séparent le travail du câble, ce n'est plus une estimation : Jev annonce son propre temps de travail dans chaque réponse, et la part de câble est la soustraction. Ce chiffre vient de lui, pas de moi. Mistral ne publiant pas l'équivalent, on ne peut pas faire la même soustraction de son côté, et les rapports affichés comparent donc deux totaux.

Pas de serveur européen pour Jev

TypeSafe indique que le service est hébergé aux États-Unis et s'appuie sur les clauses contractuelles types pour les transferts depuis l'Europe. Aucune région européenne n'est documentée. Passer par une passerelle (Cloudflare, Netlify) n'y change rien : le calcul repart chez le fournisseur, la passerelle ajoute un saut. Le modèle a été annoncé le 15 septembre 2026, cinq jours avant ces mesures. Une sortie existe déjà, mais elle ne passe pas par Jev : une dizaine de copies libres du même format (Laya, Von, kev…) sont apparues en une semaine et s'hébergent où l'on veut, donc en Europe. Je ne les ai pas mesurées.

L'écart de prix mesure ma prose autant que le modèle

Les 2 083 jetons envoyés à chaque appel sont mes propres définitions de questions, contre 259 pour un prompt compact côté génératif. L'écart de 20 % face à mistral-small vient de là. Resserrer les critères ferait baisser le prix, et pourrait dégrader le jugement : je ne l'ai pas mesuré, donc je ne peux pas le revendiquer.

Les 120 demandes sont fabriquées

Écrites par trois modèles aveugles, interdits de lire le moindre fichier du projet. Elles sont plus propres et plus franches qu'un vrai flux de PME. Les étiquettes viennent de deux lecteurs automatiques, pas d'un chef d'entreprise. Aucune donnée réelle nulle part.

Le seuil honnête est 0,50, pas 0,77

0,50 est choisi d'avance, avant de regarder les résultats : 0 demande prioritaire ratée sur 40 et 7 fausses alertes sur 76. Le seuil de 0,77 qui donne 98 % est le meilleur trouvé après coup sur ce même jeu. Il est flatteur et ne vaut que pour lui.

Le détail complet du protocole et des résultats tient dans deux comptes rendus du dépôt : le jeu de demandes et son arbitrage, et la comparaison avec Mistral.