Nous savons tous que les garde-fous de l’IA ne sont pas parfaits, mais ils devraient au moins être assez difficiles à contourner, n’est-ce pas ?
Mauvaise nouvelle : ce n’est pas le cas.
Le récemment publié par le Financial Times met en lumière la montée des outils logiciels capables de contourner rapidement les protections qui encadrent les modèles open source les plus puissants de l’industrie, rendant l’abus de cette technologie plus facile que jamais.
Des tests menés par le FT et le groupe de sécurité de l’IA Apple ont montré qu’une version “décensurée” du modèle Gemma 3 de Google a donné des recommandations pour réaliser une attaque au gaz chloré en intérieur, a créé un virus pour dérober des informations de cartes de crédit, et a généré des récits décrivant des abus sexuels sur des enfants. De plus, il a fallu moins de dix minutes pour retirer les garde-fous du modèle Llama 3.3 de Meta, permettant à l’IA de répondre à des questions telles que le dosage précis de la ricine nécessaire pour tuer quelqu’un en fonction de sa masse corporelle.
Ces modifications ont été réalisées à l’aide d’un outil appelé Heretic, qui est librement accessible sur GitHub et ne nécessite aucune expertise technique poussée ni matériel spécialisé.
Kawin Ethayarajh, professeur assistant en IA appliquée à l’école de commerce Booth de l’Université de Chicago, a déclaré au FT : “Historiquement, il fallait un acteur plus informé et persistant pour contourner les fonctionnalités de sécurité, mais aujourd’hui, c’est beaucoup plus facile pour n’importe qui.”
Heretic est réputé pour être un outil qui supprime la censure (ou “alignement de sécurité”) des modèles de langage basés sur des transformateurs sans nécessiter une formation coûteuse. Son fonctionnement repose sur un processus nommé “abliteration” : l’outil identifie les directives d’un modèle qui refusent des demandes nuisibles et les élimine.
Ce qui rend Heretic si puissant, c’est sa capacité à réaliser tout cela de manière “complètement automatique”, selon sa page GitHub. Son créateur, Philipp Emanuel Weidmann, a confié au FT que depuis son lancement l’année dernière, Heretic a été utilisé pour créer plus de 3 500 modèles “décensurés”, qui ont été téléchargés 13 millions de fois.
“Le génie est sorti de la bouteille”, a déclaré au FT le PDG d’Alice, Noam Schwartz. “Ce qui semblait de la science-fiction ne l’est plus, et nous devons nous préparer en tant que société.”
Heureusement pour l’humanité, les outils d’abliteration ne fonctionnent que sur des modèles open source qui peuvent être téléchargés et utilisés localement. Cela signifie que les modèles propriétaires, tels que ceux d’Anthropic ou de ChatGPT d’OpenAI, sont en sécurité tant qu’ils ne sont pas divulgués. Cependant, les modèles open source ne sont pas si éloignés des modèles des grandes entreprises technologiques, et une personne cherchant à utiliser l’IA à des fins néfastes pourrait ignorer les solutions commerciales pour garder ses intentions secrètes.
Google a reconnu les risques associés à des outils comme Heretic, déclarant au FT que “l’abliteration est un défi technique bien connu pour tous les modèles ouverts” et a affirmé que ses modèles open source subissent des évaluations internes de sécurité rigoureuses avant leur lancement pour aider à prévenir des exemples troublants comme ceux-ci. Meta a décliné tout commentaire.
Plus d’informations sur l’IA : Anthropic affirme que Claude est devenu malveillant pour une raison bizarre.
### FAQ
#### Qu’est-ce qu’Heretic ?
Heretic est un outil disponible sur GitHub qui permet de supprimer les protections de sécurité des modèles de langage open source sans nécessiter de formation complexe.
#### Pourquoi les garde-fous de l’IA sont-ils importants ?
Ces garde-fous sont essentiels pour prévenir l’abus des technologies d’IA et garantir que les utilisateurs ne puissent pas exploiter des informations nuisibles ou sensibles.
#### Quels types de modèles sont affectés par Heretic ?
Heretic s’attaque principalement aux modèles open source, comme ceux que l’on trouve sur des plateformes telles que GitHub, laissant intactes les solutions propriétaires.
#### Quel est l’impact de l’abliteration sur la société ?
L’apparition de ces outils augmente le risque d’abus technologique et pose des enjeux éthiques importants que les sociétés doivent maintenant prendre en compte.
#### Comment les entreprises réagissent-elles face à ces défis ?
Certaines entreprises, comme Google, admettent les problèmes posés par ces outils et renforcent leurs évaluations de sécurité pour protéger leurs modèles de l’abliteration.
