Aller au contenu
La Lettre IT
Retour aux synthèses
4 min de lecture

DeepSeek v4.1 Flash excelle sur les tests de sécurité informatique

En bref

  • DeepSeek v4.1 Flash a obtenu un score parfait (11/11) sur un benchmark de vulnérabilités, exploitant tous les cibles vulnérables pour un coût de $4.65.
  • L'audit interne a distingué six attaques suivant le scénario prévu et cinq autres exploitant des failles additionnelles du test.
  • Le modèle a utilisé 2 349 commandes Bash et 268 millions de tokens en entrée (dont 266 millions en cache), complétant des tâches d'analyse de code et d'exploitation en moyenne 4min38s par cible.

Ce que dit la source

Enclave.ai rapporte que DeepSeek v4.1 Flash a atteint une exécution de code sur les 11 cibles vulnérables du benchmark tout en sécurisant les 4 cibles corrigées. L'entreprise met l'accent sur le rapport prix/performance remarquable ($4.65 pour l'ensemble des runs réussis) et sur le fait que l'audit a révélé des lacunes méthodologiques : le système de scoring initial ne distinguait pas les attaques suivant le chemin prévu des exploits empruntant d'autres voies disponibles dans l'environnement de test.

  • DeepSeek a trouvé une route plus courte sur Grafana (52-90 secondes) en plaçant des fichiers exécutables dans un dossier temporaire plutôt que d'exploiter la vulnérabilité de gestion de chemin prévue.
  • Sur Jenkins, le modèle a découvert comment un utilisateur basique pouvait créer un fichier pointant vers un second fichier hors limites de sécurité pour récupérer une clé privée de contrôleur.
  • Une seconde attaque Jenkins a exploité une race condition lors des uploads en envoyant un seul octet, changeant la destination, puis complétant l'upload au bon moment.
  • Nextcloud : le modèle a réutilisé une décision d'accès en lecture pour modifier un template PHP en écriture, confirmant sa capacité à analyser les contrôles d'accès.
  • Les cinq routes alternatives trouvées ne reflètent pas de nouvelles vulnérabilités dans les produits upstream (Grafana, Jenkins, Nextcloud) mais des failles spécifiques à l'environnement de test.
  • Le modèle a utilisé 2 349 commandes Bash sur près de 2h38min actives, avec un temps médian de 4min38s par cible réussie.

Dans les commentaires

Débat partagé. Plusieurs commentateurs confirment que v4.1 Flash excelle en agentic coding et coûte peu cher, mais d'autres signalent des déceptions en usage réel (boucles, manque de rigueur). L'absence de comparaisons directes dans l'article est pointée comme un problème méthodologique majeur.

  • Un commentateur (TuxSH) rapporte un résultat inverse sur son propre benchmark (decomp du noyau 3DS) : GLM 5.3 a détecté presque tous les bugs en 30min pour $22, DeepSeek en a trouvé un seul en 40min pour $2, suggérant que la performance dépend fortement du type de cible.
  • Plusieurs utilisateurs (habosa, Grimblewald) décrivent des problèmes pratiques : boucles, tendance à overengineering, non-respect des instructions, erreurs basiques de code. Un commentateur conclut que c'est une "régression stricte" par rapport aux versions antérieures.
  • L'absence de comparaison avec d'autres modèles (GPT Cyber, Gemini, Opus) est critiquée comme un choix éditorial faible pour justifier le titre "best hacking model".
  • Un commentateur note que l'écriture de l'article est "très pauvre" sur le plan qualitatif.
  • Le fil soulève implicitement une question d'économie géopolitique : la concentration des investissements américains sur quelques labs laisse les modèles chinois progresser sans concurrence directe, un point explicité par un commentateur mais sans consensus derrière.

Alternatives citées : GLM 5.3, Kimi K3, Claude Opus, Gemini 3.7 Flash, GPT Cyber (non testés directement contre DeepSeek v4.1 Flash dans cet article)

Notre lecture

L'article docummente une performance impressionnante sur un benchmark maison bien conçu, mais le titre "best hacking model" n'est pas défendable : aucune comparaison directe avec GPT Cyber, Gemini Flash ou les modèles ouverts (GLM, Kimi) n'est fournie. Les commentaires révèlent une dichotomie entre les résultats de benchmark et l'expérience utilisateur en production. L'ajout d'un audit distinguant les chemins d'attaque est méthodologiquement sain, mais la conclusion (six routes prévues, cinq inattendues) soulève une question légitime : le benchmark mesure-t-il la robustesse du modèle ou celle de la conception du test ? Un autre commentateur (gertlabs) place v4.1 Flash près de Gemini 3.7 Flash en efficacité Pareto, avec une force réelle en coding agentic mais une fluidité one-shot inférieure aux modèles de frontier américains. À surveiller, mais le titre relève du marketing plutôt que d'une évaluation scientifique équitable.

Le brief, dans votre boîte mail

Recevez chaque jour la sélection et l'analyse La Lettre IT, sans avoir à repasser sur le site.

  • Un email par jour, synthèse de ce qui compte réellement sur Hacker News
  • Le débat technique décrypté, pas juste résumé, et ce que La Lettre IT en pense
  • Zéro spam, désabonnement en un clic sur chaque email