Retour aux écrits

xAI : quand l’agent dit « c’est fait » et que rien n’est fait

J’utilise Grok dans les agents de dirigeants qui ne développent pas. J’y ai relevé des échecs précis : une tâche annoncée comme faite, un appel d’outil déclaré mais jamais exécuté. Je les ai publiés en avril 2026. Depuis, j’ai travaillé avec des équipes de xAI : cas reproductibles, deux gists publics, trois correctifs intégrés dans Hermes Agent.

Contexte

J’utilise Grok dans une flotte d’agents pour des dirigeants qui ne développent pas. Les échecs que je note viennent de là : une tâche annoncée comme faite, un appel d’outil déclaré sans exécution, une trace trop brute pour servir d’évaluation.

Le 21 avril 2026, j’ai publié « The benchmark lie: why Grok 4.20 excels in benchmarks but fails in production ». Le 6 mai, Eric Jiang, de xAI, a répondu en public, sous cet article :

Awesome writeup, thank you for this. Would love your help to improve our model; DMing

Depuis, j’ai travaillé avec des équipes de xAI.

Ce qui a été fait

Un score de benchmark décrit un banc d’essai. La question que je pose est ailleurs : que fait le modèle quand une personne lui confie une tâche, dans une boucle d’agent, sur ses fichiers.

J’ai coupé les échecs en cas courts, rejouables, avec un état de départ et un état attendu. Deux de ces paquets sont publics.

Cas réussis sur 12, selon l’effort de raisonnement (Grok 4.3)

none 2,4/12 ; low 4,2/12 ; medium 4,7/12 ; high 4,8/12. Moyenne de 10 exécutions. Source : gist public du 7 mai 2026. Cas réussis sur 12, selon l’effort de raisonnement (Grok 4.3)

nonelowmediumhigh
Cas réussis sur 12, selon l’effort de raisonnement (Grok 4.3). Même au meilleur réglage, moins de la moitié des cas passent.

Même au meilleur réglage, moins de la moitié des cas passent.

Le 11 avril, un gist public décrit une garde contre la complétion hallucinée, extraite d’une session Hermes sous Grok 4.20, le 10 avril. Le 7 mai, un autre gist public rejoue 12 cas réels, 10 fois chacun, sous Grok 4.3, en faisant varier l’effort de raisonnement.

D’autres paquets sont restés privés. Je les décris par leur date, leur nombre et leur type. Jamais par leur adresse, ni par leur contenu.

DatePièceStatut
11 avrilGarde de complétion, session du 10 avrilPublic
7 mai12 cas réels, 10 exécutions chacunPublic
7–11 maiBenchmarks sur des replays réels, dont un palier instrumenté : 5 conditions, 12 cas, 3 répétitionsPrivé
12 maiRapport de 8 casPrivé
12 mai2 comparaisons sur un checkpointPrivé
17 mai5 reproductions de blocages de productionPrivé
12 juin1 reproduction : le même parcours passe de 10 minutes à 33,9 secondesPublic, sur le site

Le 12 juin, « Making Grok act » décrit une correction de prompt système. Sur une reproduction, le même parcours passe de 10 minutes à 33,9 secondes. Un cas. Pas un benchmark.

Trois correctifs touchant xAI sont intégrés dans Hermes Agent, avec mon nom conservé dans l’historique. Le 10 avril, le fournisseur xAI natif, pull request 7372. Le 9 mai, la transmission de l’effort de raisonnement à l’API xAI, pull request 22807. Le 12 septembre, un correctif qui supprime une erreur 400 sur l’appel de synthèse en fin d’itérations, pull request 109295. Le 23 mai, Teknium a écrit, en public : « Thanks to Julien Grok Build v0.1 now has its appropriate 256K context length in Hermes ».

Ce qui a changé

Échanges publics

  1. 21 avr.

    « The Benchmark Lie »

  2. 6 mai

    Réponse publique d’Eric Jiang

  3. 23 mai

    Note de Teknium, contexte 256K

  4. 8 juil.

    Remerciement public de Miłosz Jankiewicz

  5. 14 juil.

    Model card Grok 4.5, FalseClaimBench

  6. 22 juil.

    Article : je ne suis pas l’auteur de FalseClaimBench

Pièces publiques seulement, liées dans les sources.

Échanges publics. Pièces publiques seulement, liées dans les sources.

Mesuré, au sens d’un acte public. La réponse d’Eric Jiang ouvre la relation : elle est datée, elle est publique, elle est citée telle quelle. Le 8 juillet, Miłosz Jankiewicz a remercié publiquement « for all the support and feedback ». Le 21 août, il a répondu en public à une suggestion sur la voix temps réel : « Ok, will ship voice s2s. Give me a day ». La livraison de cette voix n’est pas vérifiée.

Les équipes ont demandé des reproductions, examiné des traces, et ouvert des accès anticipés à des checkpoints avant leur sortie. Le détail de ces demandes et de ces accès vient d’échanges privés. Je ne les cite pas, et je ne les date pas personne par personne.

La model card de Grok 4.5, du 14 juillet 2026, décrit FalseClaimBench, une évaluation interne : comparer ce que l’agent affirme avoir fait à l’état final réel de l’espace de travail. C’est la même famille d’échec que celle que je documente depuis mai. Le 22 juillet, j’ai écrit que je n’en suis pas l’auteur : le nom, le dispositif et la pile d’évaluation sont ceux de xAI. La convergence est le fait que je retiens. Elle ne prouve pas que mes cas ont servi à l’entraînement, ni qu’ils ont changé un modèle.

Limites

Je ne publie pas les messages privés, ni le contenu des rapports restés privés.

Aucune de ces pièces n’établit un contrat, un paiement, un rôle officiel, ni un titre de bêta-testeur. Les pull requests ouvertes le 21 septembre pour Grok 4.7, et la reprise proposée le 22 septembre pour la transcription vocale, ne sont pas comptées comme intégrées.

Sources