Intelligence Artificielle

Astuce Infaillible Pour Déjouer les Modèles d’IA de Raisonnement

Astuce Infaillible Pour Déjouer les Modèles d'IA de Raisonnement

Les Limites de la Raisonnement des Modèles d’IA Avancés

Une récente étude menée par une équipe de chercheurs d’Apple jette un éclairage sur les prétendues capacités de raisonnement des modèles d’intelligence artificielle (IA), révélant qu’elles ne sont pas aussi impressionnantes qu’on pourrait le penser.

Le Flou autour du Raisonnement en IA

Le terme « raisonnement » est souvent utilisé dans le secteur de l’IA, en particulier dans le cadre de la promotion des modèles de langage avancés. Par exemple, OpenAI a récemment lancé son modèle « Strawberry », présenté comme capable de raisonnement avancé. Cependant, cette appellation a depuis été changée en simplement « o1 ».

Malgré le battage médiatique, il n’existe pas de définition claire et acceptée de ce qu’est réellement le raisonnement. Comme d’autres termes de l’IA tels que « conscience » ou « intelligence », le raisonnement reste un concept difficile à cerner. Actuellement, ce que l’on appelle le raisonnement en IA pourrait être vu comme l’aptitude d’un modèle de langage à « réfléchir » à des requêtes et des problèmes complexes de manière similaire aux humains.

A lire :  À peine tournée la page du non‑lucratif, OpenAI vise déjà la Bourse

Mesurer le Raisonnement en IA

Cette notion est cependant complexe à mesurer. Selon l’étude des scientifiques d’Apple, les capacités de raisonnement des modèles de langage avancés sont finalement bien plus limitées que supposées. Pour leur recherche, les scientifiques se sont concentrés sur le benchmark GSM8K, un ensemble de données couramment utilisé pour évaluer les compétences en raisonnement des IA, composé de plusieurs milliers de problèmes mathématiques adaptés à des élèves de primaire.

Fait intéressant, ils ont découvert que des petites modifications apportées à ces problèmes, comme changer un chiffre ou le nom d’un personnage, entraînaient un nombre d’erreurs considérable de la part des modèles d’IA.

Résultats de l’Étude

En résumé, lorsque des modifications subtiles étaient apportées aux questions du GSM8K sans affecter les mécanismes des problèmes, les modèles d’IA ne parvenaient pas à suivre. Les chercheurs concluent que ces modèles n’effectuent pas un raisonnement à l’image des humains, mais plutôt qu’ils participent à un appariement de modèles sophistiqué basé sur les données d’entraînement dont ils disposent.

Ils suggèrent que cette incapacité à raisonner de manière logique pourrait être due au fait que les modèles tentent simplement de reproduire les étapes de raisonnement présentes dans leurs données d’apprentissage.

Un Exemple Éloquent

Un exemple particulièrement révélateur de cette situation est un problème mathématique portant sur des kiwis :

Oliver cueille 44 kiwis un vendredi. Le lendemain, il en cueille 58. Le dimanche, il en prend le double de ce qu’il avait pris vendredi, mais cinq d’entre eux étaient plus petits que la moyenne. Combien de kiwis Oliver a-t-il ?

La taille des kiwis ne devrait pas influer sur le total final, mais comme le montre cette étude, la plupart des modèles AI interprètent ces détails supplémentaires, ce qui entraîne des erreurs dans leurs raisonnements.

A lire :  Apple : L’ère de la révision humaine des enregistrements Siri est révolue.

Un modèle d’OpenAI, baptisé « o1-mini », a répondu de manière incorrecte en déduisant ces cinq kiwis plus petits du total, ajoutant ainsi une confusion supplémentaire.

Des Chutes Notables de Performance

Les chercheurs ont constaté que la précision des modèles d’IA diminuait entre 17,5 % et 65,7 %, en fonction du modèle utilisé. Dans une simulation plus basique, le changement de détails tels que des noms propres ou des chiffres a provoqué une chute significative dans la capacité des modèles à fournir les bonnes réponses, avec une précision chutant à près de 10 %.

La sensibilité des modèles aux modifications de noms ou de chiffres soulève des questions quant à la fiabilité des évaluations actuelles de ces modèles d’IA.

Interrogations sur l’Intelligence des Modèles

Les résultats de cette étude remettent en question non seulement l’intelligence des modèles d’IA avancés, mais aussi la méthode d’évaluation des performances que nous utilisons pour les commercialiser. Apprendre une langue simplement en mémorisant des phrases phonétiquement ne signifie pas que l’on maîtrise réellement cette langue. Cela démontre seulement une familiarité limitée avec les sons et les mots.

Conclusion et Défis Futurs

Comprendre les capacités de raisonnement véritable des modèles de langage est essentiel pour les déployer dans des scénarios du monde réel, notamment dans des domaines où la précision et la constance sont critiques, comme la sécurité de l’IA, l’éducation ou la prise de décisions. Les chercheurs soulignent l’importance de développer des méthodes d’évaluation plus robustes et adaptables, et de dépasser la simple reconnaissance de motifs pour parvenir à un raisonnement logique véritable, ce qui représente le prochain grand défi pour la communauté des IA.

A lire :  Le Grand Projet d'OpenAI: Des Défis Inattendus en Coulisses.

FAQ

Quelles sont les erreurs courantes des modèles d’IA dans le raisonnement?

Les modèles d’IA se trompent souvent en intégrant des détails non pertinents dans leurs calculs ou en simplifiant trop les problèmes.

Comment le benchmark GSM8K est-il utilisé pour tester les modèles d’IA?

Le GSM8K est composé de problèmes mathématiques de niveau scolaire qui aident à évaluer la capacité des modèles à raisonner et résoudre des mathématiques complexes.

Pourquoi le raisonnement des modèles d’IA est-il si important?

Le raisonnement est crucial pour des applications en IA où des décisions précises sont nécessaires, comme la santé, l’éducation et la sécurité.

Les modèles d’IA peuvent-ils apprendre de leurs erreurs?

Actuellement, les modèles d’IA ne « comprennent » pas leurs erreurs de la même manière qu’un humain et ont besoin d’un entraînement constant pour améliorer leur précision.

Quelles sont les implications des résultats de l’étude pour le développement futur de l’IA?

Les résultats indiquent qu’il est nécessaire de réévaluer les approches actuelles dans la conception et l’évaluation de l’intelligence artificielle pour que celle-ci atteigne un niveau de raisonnement semblable à celui des humains.