Jev Ultrafast : un agent navigateur avec espace d'actions dynamique et indexé
En bref
- Jev Ultrafast est un agent navigateur construit sur une architecture à deux décisions par cycle : identification d'une opération (clic, texte, sélection, scroll, attente) puis de sa cible sur l'élément indexé.
- Démonstrateurs : recherche Google Flights en 7,1 secondes, article Wikipedia trouvé en 2,8 secondes, aucune injection de JavaScript côté navigateur ni sélecteurs générés.
- L'approche repose sur un modèle LLM petit et rapide pour le texte seul, tandis qu'une API TypeSafe gère les décisions structurées (opération, cible).
- Code open source disponible avec support OpenRouter, Gemini, GLM, DeepSeek.
- Le projet affiche aussi Browser Use Cloud, une version cloud en waitlist, distincte de l'implémentation locale.
Ce que dit la source
Les agents navigateurs actuels consomment beaucoup de ressources et passent par des cycles d'observation-décision coûteux : screenshots, inférences LLM complètes, reconstruction d'état. Jev Ultrafast propose une alternative où chaque cycle ne produit qu'une seule requête réseau : l'observation du DOM crée une table d'éléments indexés, une API TypeSafe retourne deux décisions structurées (opération compatible, cible valide), et un petit LLM génère du texte uniquement si l'opération l'exige. Cela éliminerait les goulots (screenshots répétés, appels API inutiles pour les clics, validation post-décision) et réduirait le latency au cas Google Flights de 25 % en médiane (9,5 s → 7,1 s) et les appels navigateur de 91 % (1 092 → 101).
- Architecture deux-décisions : une requête TypeSafe retourne operation (CLICK, TYPE_TEXT, SELECT, SCROLL_UP, SCROLL_DOWN, WAIT, DONE, BLOCKED) et target indexée, éliminant les screenshots dans la boucle principale
- Pas de code spécifique au site ou de JavaScript injecté : le modèle reçoit une table d'éléments observés (nom, valeur, index), validant la géométrie et l'occlusion avant exécution
- LLM pour texte uniquement : inception/mercury-2.5 dans la démo, sans reasoning activé, compatible OpenAI (Gemini, GLM, DeepSeek)
- Démonstration partielle : vol Zurich-Londres en 7,1 s (timing après observation initiale, charges incluses), article Wikipedia trouvé en 2,8 s, mais mesure sur une tâche unique, trois repeats, un profil navigateur, pas une évaluation de fiabilité générale
- Code ouvert, local en premier : clone Git, configuration .env (TYPESAFE_API_KEY, TEXT_MODEL_API_KEY), démo Web sur http://127.0.0.1:8766, inspector affichant probabilités opération/cible et actions exécutées
Dans les commentaires
Débat partagé, avec réserves fortes sur l'accessibilité et les limites réelles.
- Plusieurs commentateurs demandent si le fonctionnement en local est vraiment possible ou s'il reste tributaire d'une API cloud payante (TypeSafe) : un commentateur souligne que ce n'est « pas vraiment local si on paie un AI tax à des gatekeepers » pour chaque utilisation
- Critique sur la télémétrie par défaut : Browser Use envoie des données à PostHog en activé par défaut, notamment depuis le composant Browser Harness, risquant de fuiter des credentials
- Deux utilisateurs rapportent que le bouton de démo ne fonctionne pas (erreur exécution, absence d'erreur compilation)
- Un commentateur conteste la pertinence du démonstrateur Google Flights, arguant que les paramètres de vol peuvent être construits par protobuf sans agent
- Le score de 7,1 s omet le timing d'observation initiale du DOM, ce qui pourrait exagérer la performance perçue
Alternatives citées : Commentateurs citent implicitement Google Flights direct (sans agent) comme alternative pour le cas d'usage ; aucun outil concurrent nommé explicitement.
Notre lecture
Jev Ultrafast présente une architecture intéressante : cycle court (une décision réseau par action), état structuré plutôt que screenshots répétés, validation géométrique. Les gains de latency observés sur deux tâches sont réels mais limités à un contexte contrôlé. Le point critique non résolu : TypeSafe reste une dépendance cloud payante, ce qui contredit l'angle « local et rapide ». Les problèmes de télémétrie non opt-in et les rapports de démo cassée réduisent la confiance. Intéressant pour comprendre un design d'agent efficace, mais loin d'être une solution clé en main ou une percée fiabilité. À tester en local avant d'investir.