xAI : quand l’agent dit « c’est fait » et que rien n’est fait
J’utilise Grok dans les agents de dirigeants qui ne développent pas. J’y ai relevé des échecs précis : une tâche annoncée comme faite, un appel d’outil déclaré mais jamais exécuté. Je les ai publiés en avril 2026. Depuis, j’ai travaillé avec des équipes de xAI : cas reproductibles, deux gists publics, trois correctifs intégrés dans Hermes Agent.
Contexte
J’utilise Grok dans une flotte d’agents pour des dirigeants qui ne développent pas. Les échecs que je note viennent de là : une tâche annoncée comme faite, un appel d’outil déclaré sans exécution, une trace trop brute pour servir d’évaluation.
Le 21 avril 2026, j’ai publié « The benchmark lie: why Grok 4.20 excels in benchmarks but fails in production ». Le 6 mai, Eric Jiang, de xAI, a répondu en public, sous cet article :
Awesome writeup, thank you for this. Would love your help to improve our model; DMing
Depuis, j’ai travaillé avec des équipes de xAI.
Ce qui a été fait
Un score de benchmark décrit un banc d’essai. La question que je pose est ailleurs : que fait le modèle quand une personne lui confie une tâche, dans une boucle d’agent, sur ses fichiers.
J’ai coupé les échecs en cas courts, rejouables, avec un état de départ et un état attendu. Deux de ces paquets sont publics.
Cas réussis sur 12, selon l’effort de raisonnement (Grok 4.3)
none 2,4/12 ; low 4,2/12 ; medium 4,7/12 ; high 4,8/12. Moyenne de 10 exécutions. Source : gist public du 7 mai 2026. Cas réussis sur 12, selon l’effort de raisonnement (Grok 4.3)
Même au meilleur réglage, moins de la moitié des cas passent.
Le 11 avril, un gist public décrit une garde contre la complétion hallucinée, extraite d’une session Hermes sous Grok 4.20, le 10 avril. Le 7 mai, un autre gist public rejoue 12 cas réels, 10 fois chacun, sous Grok 4.3, en faisant varier l’effort de raisonnement.
D’autres paquets sont restés privés. Je les décris par leur date, leur nombre et leur type. Jamais par leur adresse, ni par leur contenu.
| Date | Pièce | Statut |
|---|---|---|
| 11 avril | Garde de complétion, session du 10 avril | Public |
| 7 mai | 12 cas réels, 10 exécutions chacun | Public |
| 7–11 mai | Benchmarks sur des replays réels, dont un palier instrumenté : 5 conditions, 12 cas, 3 répétitions | Privé |
| 12 mai | Rapport de 8 cas | Privé |
| 12 mai | 2 comparaisons sur un checkpoint | Privé |
| 17 mai | 5 reproductions de blocages de production | Privé |
| 12 juin | 1 reproduction : le même parcours passe de 10 minutes à 33,9 secondes | Public, sur le site |
Le 12 juin, « Making Grok act » décrit une correction de prompt système. Sur une reproduction, le même parcours passe de 10 minutes à 33,9 secondes. Un cas. Pas un benchmark.
Trois correctifs touchant xAI sont intégrés dans Hermes Agent, avec mon nom conservé dans l’historique. Le 10 avril, le fournisseur xAI natif, pull request 7372. Le 9 mai, la transmission de l’effort de raisonnement à l’API xAI, pull request 22807. Le 12 septembre, un correctif qui supprime une erreur 400 sur l’appel de synthèse en fin d’itérations, pull request 109295. Le 23 mai, Teknium a écrit, en public : « Thanks to Julien Grok Build v0.1 now has its appropriate 256K context length in Hermes ».
Ce qui a changé
Échanges publics
21 avr.
« The Benchmark Lie »
6 mai
Réponse publique d’Eric Jiang
23 mai
Note de Teknium, contexte 256K
8 juil.
Remerciement public de Miłosz Jankiewicz
14 juil.
Model card Grok 4.5, FalseClaimBench
22 juil.
Article : je ne suis pas l’auteur de FalseClaimBench
Pièces publiques seulement, liées dans les sources.
Mesuré, au sens d’un acte public. La réponse d’Eric Jiang ouvre la relation : elle est datée, elle est publique, elle est citée telle quelle. Le 8 juillet, Miłosz Jankiewicz a remercié publiquement « for all the support and feedback ». Le 21 août, il a répondu en public à une suggestion sur la voix temps réel : « Ok, will ship voice s2s. Give me a day ». La livraison de cette voix n’est pas vérifiée.
Les équipes ont demandé des reproductions, examiné des traces, et ouvert des accès anticipés à des checkpoints avant leur sortie. Le détail de ces demandes et de ces accès vient d’échanges privés. Je ne les cite pas, et je ne les date pas personne par personne.
La model card de Grok 4.5, du 14 juillet 2026, décrit FalseClaimBench, une évaluation interne : comparer ce que l’agent affirme avoir fait à l’état final réel de l’espace de travail. C’est la même famille d’échec que celle que je documente depuis mai. Le 22 juillet, j’ai écrit que je n’en suis pas l’auteur : le nom, le dispositif et la pile d’évaluation sont ceux de xAI. La convergence est le fait que je retiens. Elle ne prouve pas que mes cas ont servi à l’entraînement, ni qu’ils ont changé un modèle.
Limites
Je ne publie pas les messages privés, ni le contenu des rapports restés privés.
Aucune de ces pièces n’établit un contrat, un paiement, un rôle officiel, ni un titre de bêta-testeur. Les pull requests ouvertes le 21 septembre pour Grok 4.7, et la reprise proposée le 22 septembre pour la transcription vocale, ne sont pas comptées comme intégrées.
Sources
- « The Benchmark Lie », 21 avril 2026. Réponse d’Eric Jiang, 6 mai 2026.
- Garde de complétion, gist public du 11 avril 2026.
- Benchmark public du 7 mai 2026 : 12 cas réels, 10 exécutions, effort de raisonnement sous Grok 4.3.
- Note de Teknium, 23 mai 2026. Remerciement de Miłosz Jankiewicz, 8 juillet 2026. Réponse sur la voix, 21 août 2026.
- « FalseClaimBench: the right to stop checking », 22 juillet 2026. Model card Grok 4.5, 14 juillet 2026, section 2.11.
- Hermes Agent : pull request 7372, 22807, 109295.
- « Making Grok act », 12 juin 2026.