AutoBot : harness open-source pour agent IA avec mémoire locale et contrôle vocal
En bref
- AutoBot est un harness open-source (MIT) qui s'intègre dans ChatGPT ou Codex sur macOS, ajoutant une mémoire persistante sur disque, des zones de confidentialité et un validateur indépendant.
- Il affiche 50,70% de précision sur AssistantBench (181 tâches), classé #1, et 32,41% sur OSWorld 2.0, dépassant GPT-5.6 Sol Max.
- L'outil gère les workflows interrompus via des checkpoints persistants et sépare la validation de la production.
Ce que dit la source
L'auteur présente AutoBot comme une réponse aux limites des agents IA actuels : les tâches longues interrompues perdent leur contexte, il n'existe pas de séparation claire entre validation et production, et les zones de confidentialité manquent. AutoBot s'exécute localement sur Mac (pas dans le cloud OpenAI) et conserve la mémoire de travail sur disque, inspectable et modifiable par l'utilisateur.
- Intégration dans le projet local ChatGPT/Codex native sur macOS, sans gateway externe ni modèle séparé.
- Mémoire hiérarchique sur disque avec zones de confidentialité (personnel, famille, travail, partagé) et zoning explicite des flux.
- Validateur de complétude indépendant du producteur : le runtime local rejette les validations signées du modèle et exige une vérification externe.
- Persistance des tâches via checkpoints : objectif, étapes, preuves et état de récupération sauvegardés, permettant la reprise après interruption.
- AssistantBench #1 avec 50,70% (181 tâches, 100% taux de réponse) ; OSWorld 2.0 32,41% d'exactitude binaire, 18,5 points au-dessus de GPT-5.6 Sol Max.
- Actions externes signées via l'app first-party (Computer Use) avec vérifications de compte, destination et contenu préalables et vérification du résultat rendu.
- Six compétences portables incluses dans v0.5.0 (détails tronqués dans la source fournie).
Dans les commentaires
Débat minimal et hors-sujet : un seul commentaire pertinent, signalant une approche parallèle (iPhone Shortcut pour tâches Claude async), aucune contestation substantielle ni discussion technique.
- Le fil est trop court pour extraire des frictions réelles : un seul commentaire hors-sujet sur une approche parallèle personnelle.
Notre lecture
AutoBot adresse un besoin réel : durabilité des workflows d'agent et mémoire inspectable sans dépendre d'une plateforme cloud. Les benchmarks (AssistantBench #1) sont prometteurs, mais leur reproductibilité reste à vérifier, les chiffres comparent un harness spécifique à des résultats publiés d'autres modèles en configuration différente. L'intérêt principal pour un DSI ou une équipe devrait porter sur la persistance et la traçabilité, pas sur les classements bruts. À tester si vous avez des workflows IA long-running que vous voulez contrôler et auditer localement ; sans importance immédiate sinon.