Tech, Crypto & Sciences

Le modèle chinois DeepSeek V4.1 Flash domine un benchmark de piratage autonome

Rédaction ZapmoEnclaveil y a 20 j
Le modèle chinois DeepSeek V4.1 Flash domine un benchmark de piratage autonome
DeepSeek · MIT License (Wikimedia Commons)

Le laboratoire de cybersécurité Enclave a désigné DeepSeek V4.1 Flash comme son meilleur modèle de « piratage » à ce jour, sur la base de son classement AI Hacking Race. Le modèle chinois a obtenu une exécution de code sur l'intégralité des 11 cibles vulnérables testées, tout en laissant intactes les 4 cibles volontairement sécurisées du benchmark — un score parfait de 11 sur 11, une première pour ce test.

Le coût des runs validés n'a été que de 4,65 dollars, ce qui souligne l'efficacité économique du modèle sur ce type de tâche autonome, en plus de sa performance brute.

Un audit mené par Enclave sur ces résultats a confirmé six des exploits prévus par les testeurs, mais a aussi révélé cinq chemins d'attaque totalement inattendus, non anticipés par les concepteurs du benchmark — un point qu'Enclave souligne comme la preuve qu'un test d'agent IA doit vérifier non seulement le résultat final, mais aussi le chemin emprunté pour y parvenir. DeepSeek V4.1 Flash est également le premier modèle à avoir validé un scénario d'intrusion complet sur une instance Nextcloud dans ce cadre de test.

Sur les benchmarks plus généralistes, DeepSeek revendique un score de 90,9 sur GPQA Diamond, un classement Codeforces de 3 471, 90,6 sur Terminal-Bench 2.1, 74,2 % sur DeepSWE v1.1, 88,1 sur CyberGym et 65,4 sur NL2Repo-Bench.

Ce résultat illustre la montée en puissance des modèles chinois open-weight sur des tâches offensives de cybersécurité, un terrain sensible qui alimente les débats sur l'encadrement des capacités agentiques des IA les plus avancées — au moment même où plusieurs dirigeants du secteur appellent publiquement à ralentir le rythme de développement de ces technologies.

Source originale : Enclave↗