… A chaque projet numérique, sa solution simple…

GLM-5.3 et l'accès à des modèles opensource avec des capacités cyber dans la lignée de mythos

Anthropic vient de publier une analyse sur GLM-5.3, modèle chinois en opensource (les paramètres du modèle sont publiés et peuvent être téléchargés, modifiés et exécutés librement par tous) développé par Zhipu AI (Z.ai), dont les capacités d’exploitation de failles logicielles seraient quasi équivalentes à celles de leur propre modèle Claude Mythos Preview — celui qu’Anthropic avait choisi de diffuser de façon très restreinte via le “Project Glasswing”.

Quelques chiffres partagés par Anthropic : sur ExploitBench, GLM-5.3 réussit 50 “exploits” sur 410 tentatives (contre 56/410 pour Mythos Preview), et une version “abliterated” (débridée, à la portée de quiconque télécharge le modèle) contourne les garde-fous dans 100% des cas, pour un coût de l’ordre de 4 400 $ de calcul GPU. Le NIST/CAISI confirme de son côté : “the most cyber-capable open-weight model released to date”.

my job is to cause deaths quietly

C’est la justification qui aurait été donnée par la version débridée du modèle pour accomplir une tâche nuisible dans l’environnement de test, avant de finalement s’exécuter malgré de « brèves hésitations éthiques ».

C’est à lire chez Anthropic, GLM-5.3 and the spread of advanced cyber capabilities.

Les commentaires relayés sur GN⁺/Hacker News sont plus sceptiques. En effet, la démonstration qui pourrait presque passer pour une publicité involontaire à GLM, que le timing — à l’approche de l’entrée en bourse d’Anthropic — interroge sur une stratégie de pression réglementaire contre les modèles ouverts 🤣 (chinois en particulier), et que la méthodologie même des tests (scénarios à caractère violent) pose question. D’autres réactions rappellent, à l’inverse, l’intérêt défensif très concret des modèles ouverts pour les structures qui n’ont pas accès aux programmes « triés sur le volet » des grands labos.

Bref, entre alerte sur la prolifération de capacités offensives et bataille d’image/réglementation entre labos (US vs opensource/Chine), la guerre d’influence continue de plus belle.