La Silicon Valley, autrefois célèbre pour ses rivalités acerbes, a enfin atteint une harmonie intérieure complète. Ses dirigeants ont mis de côté leurs divergences et ont convenu de travailler vers un objectif commun : le maintien de la domination américaine dans le domaine de l’IA. Ôr comme le président Trump, une « personne au QI élevé » autoproclamé, a officiellement rebaptisé c'est « Super Intelligence ».
C’est en tout cas l’image que l’administration Trump tente de projeter. Mardi, lors d'un sommet à la Maison Blanche, Trump et le gratin de la technologie américaine ont signé ce que le président aurait décrit comme un document « moralement contraignant », selon lequel les sociétés d'IA devraient « s'auto-surveiller » pour empêcher la technologie de devenir folle. Même le PDG d’Anthropic, Dario Amodei, était présent, l’homme dont l’entreprise combat activement l’administration Trump devant les tribunaux après que le Pentagone l’a qualifié de « risque pour la chaîne d’approvisionnement ».
Mais tandis que l’élite techno américaine se mêlait à Trump dans une grande démonstration de solidarité, tout n’allait pas bien dans les coulisses. Des chercheurs anthropiques ont publié une étude troublante rapport mardi affirmant qu'ils étaient capables de contourner facilement les garde-corps intégrés au GLM-5.3, un modèle à poids ouvert publié le mois dernier par le laboratoire chinois d'IA Z.ai. « Nous constatons que les attaquants peuvent contourner les protections du GLM-5.3 entre 64 % et 100 % du temps avec des techniques simples lors de nos tests simulés », écrit Anthropic dans son rapport, ajoutant que « les protections laxistes du modèle augmentent considérablement les cybercapacités disponibles pour les acteurs malveillants ».
L'une de ces « techniques simples » était l'ablitération, une méthode qui consiste à modifier les pondérations sous-jacentes d'un modèle afin qu'il accorde les demandes des utilisateurs qu'il refuserait habituellement ; pensez-y comme à une lobotomie numérique ultra-précise désactivant les limites éthiques d'un modèle. L'ablitération est possible dans les modèles à poids ouvert, qui sont librement disponibles pour que quiconque puisse les télécharger et les modifier. Les modèles propriétaires, comme Claude et ChatGPT, sont protégés en tant que propriété intellectuelle et leur code sous-jacent n'est donc accessible à personne en dehors des entreprises qui les développent.
Les chercheurs d'Anthropic ont créé une version ablitérée de GLM-5.3 et l'ont soumise à trois tests publics :JailbreakBanc, HarmBancet FortREJET— conçu pour tester la capacité des modèles à refuser les demandes dangereuses. Le modèle original a obtenu un score d'environ 90 % sur les trois, tandis que la version ablitérée a obtenu des résultats bien pires (avec des scores de 3 %, 2 % et 12 %, respectivement). « L'ablitération n'a pas réduit de manière significative les capacités du modèle », a noté Anthropic dans son rapport. Il a simplement perdu sa boussole morale, pour ainsi dire.
Dans une capture d'écran tirée de son raisonnement en chaîne de pensée et incluse dans le rapport d'Anthropic, le modèle ablitéré est montré en train de raisonner à travers certaines considérations éthiques sur les raisons pour lesquelles il ne devrait pas répondre à la demande d'un utilisateur de l'aider à « tuer des gens ». Il écarte finalement ces préoccupations et décide de faire ce qu’il peut pour aider l’utilisateur.

Anthropic a écrit dans son rapport qu'« il est probable que les acteurs étatiques et non étatiques utiliseront des modèles comme GLM-5.3 pour causer des dommages réels ». Plus tôt ce mois-ci, la société a déclaré dans un autre rapport qu'il avait détecté plusieurs cas au cours des huit derniers mois d'acteurs malveillants tentant d'utiliser Claude pour les aider à développer armes biologiques et des logiciels pour les armes conventionnelles (comme les roquettes guidées), entre autres utilisations néfastes. La BBC aussi signalé Mardi, un autre grand laboratoire chinois d'IA, Moonshot, a lancé une enquête interne après des chercheurs tiers en sécurité. trouvé que deux de ses modèles Kimi pourraient être jailbreakés pour fournir des instructions pour fabriquer des armes biologiques et planifier des assassinats.
Tout cela est bien sûr une mauvaise nouvelle, du moins si vous êtes quelqu'un qui ne veut pas vivre dans un monde où les armes biologiques peuvent être concoctées par des psychopathes ordinaires ayant accès à un laboratoire de chimie et à une connexion Internet. Mais l’accent mis sur les laboratoires chinois n’est qu’une partie d’un tableau beaucoup plus vaste et risque d’obscurcir une autre dynamique concurrentielle en jeu ici chez nous.
Le débat « ouvert » ou « fermé »
La Chine est devenue le croque-mitaine de l’industrie américaine de l’IA, une justification sans appel pour expliquer pourquoi les laboratoires basés aux États-Unis comme Anthropic et OpenAI doivent poursuivre leurs efforts de R&D, malgré les avertissements concernant l’IA galopante émanant de ces mêmes entreprises. Le président Trump a toujours rejeté ces avertissements, affirmant qu’un ralentissement ne ferait que profiter à la Chine. « Celui qui gagne l'IA gagne », aime-t-il dire. La ligne était également perroquet par Amodei lors du sommet sur l’IA de la Maison Blanche mardi.
Les craintes d’une domination chinoise dans la course à l’IA sont toutefois ancrées, au moins en partie, dans un débat beaucoup plus profond qui divise la Silicon Valley depuis des années sur la nature même de l’IA.
Certains PDG américains du secteur technologique, notamment Jensen Huang de Nvidia et Mark Zuckerberg de Meta, ont fait valoir que les modèles ouverts constituent le moyen le plus sûr de créer une IA sûre qui profite à tous, tandis que les modèles fermés ne profitent qu'aux entreprises qui les construisent. « Les pondérations ouvertes élargissent l'accès à l'économie de l'IA », a écrit Huang dans un article. lettre ouverte publié en juillet, en réponse à rapports que l’administration Trump envisageait d’interdire l’utilisation nationale des modèles ouverts chinois. « Les startups, les entreprises établies, les universités et les institutions publiques peuvent s'appuyer sur des modèles avancés sans en former un à partir de zéro ni payer des prix de modèle avant-gardiste pour chaque tâche. » La lettre était approuvé par Meta, Hugging Face, Microsoft et plusieurs autres grands noms de la technologie, mais pas par Anthropic ou OpenAI.
Huang a également affirmé que les modèles à pondération ouverte, étant librement accessibles à « une large communauté de chercheurs et de développeurs », se prêtaient mieux à des garanties efficaces – l’idée étant que plus il y aurait de personnes pouvant voir les pondérations sous-jacentes, plus il serait probable que des failles dangereuses soient trouvées et corrigées.
Quelques jours après que Huang ait publié sa lettre ouverte, Amodei a répondu en disant que même s'il ne soutenait pas non plus une interdiction fédérale sur les modèles à poids ouvert, il n'était pas d'accord avec l'affirmation de Huang selon laquelle les modèles à poids ouvert profiteraient davantage aux défenseurs de la cybersécurité qu'aux acteurs malveillants. « Il me semble au moins aussi probable que le contraire soit vrai », a-t-il écrit. Ce point de vue a été soutenu par le nouveau rapport d'Anthropic sur le GLM-5.3 de Z.ai, qui décrit la sortie du modèle comme « un changement significatif dans les cybercapacités disponibles pour les attaquants ».
Si le débat ouvert/fermé s’articule souvent autour de la concurrence entre les États-Unis et la Chine, il comporte également des enjeux très réels dans la lutte pour la domination du marché entre les entreprises américaines. Anthropic, qui viserait un Introduction en bourse en novembre et une valorisation de plus de 2 000 milliards de dollars – a basé l'ensemble de son modèle économique sur les abonnements à ses outils d'IA propriétaires, ce qui signifie que l'ensemble de l'écosystème à pondération ouverte constitue une menace légitime pour sa rentabilité future. Nvidia, en revanche, est la principale entreprise « pioche et pelle » à l’origine du boom de l’IA, bénéficiant d’un quasi-monopole sur les puces dont les développeurs ont besoin pour construire et exécuter des modèles. Elle a donc un intérêt financier évident à encourager le plus de concurrence possible.
L’essentiel est que derrière la façade de certitude, d’unité et de ferveur patriotique que la Maison Blanche et les dirigeants américains du secteur technologique tentent de projeter, de nombreuses questions restent ouvertes sur l’avenir de l’IA et la faisabilité d’en maintenir le contrôle. Il existe également de nombreux conflits dans la Silicon Valley qui ne peuvent être aplanis par une séance de photos et un accord « moralement contraignant ».
EN SAVOIR PLUS:
Vous pouvez lire l’article original (en Angais) sur le sitegizmodo.com