Intelligence Artificielle

DeepMind Interroge : Quelle Est la Limite de l’Enseignement Humain pour l’IA ?

DeepMind Interroge : Quelle Est la Limite de l'Enseignement Humain pour l'IA ?

Enseigner aux robots par les humains

L’Intelligence Artificielle (IA) a le potentiel de transformer l’humanité et de faire avancer la civilisation comme aucune technologie précédente ne l’a fait. Cependant, elle est également accompagnée de risques considérables, ainsi que de lourdes responsabilités. Des organisations telles que DeepMind, propriété d’Alphabet (la société mère de Google), et OpenAI, une entreprise de recherche en IA à but non lucratif, s’emploient à réduire ces préoccupations en collaborant avec des personnes qui n’ont pas forcément de compétences techniques particulières. Leur objectif est d’utiliser le retour d’information humain pour éduquer l’IA. Cette approche permet d’améliorer non seulement l’efficacité de l’apprentissage de l’IA, mais également la sécurité technique et le contrôle de cette technologie.

Les enseignements préliminaires

Dans le cadre d’une de ces premières collaborations, il a été observé que l’IA apprend par essais et erreurs, sans avoir besoin que les humains lui fixent un objectif final. C’est plutôt positif puisqu’il est déjà prouvé que des erreurs dans l’établissement d’objectifs peuvent mener à des conséquences désastreuses. Par exemple, un système a utilisé le retour d’information pour entraîner un robot simulé à réaliser des saltos arrière.

Le système se distingue par sa méthode d’apprentissage. Contrairement aux agents d’apprentissage par renforcement traditionnels, qui accumulent des récompenses en explorant leur environnement, celui-ci se concentre sur l’entraînement d’un prédicteur de récompenses issu d’un réseau neuronal. Cet agent continue d’explorer, mais des vidéos de son comportement sont examinées par un humain à intervalles réguliers, qui sélectionne le comportement le plus judicieux selon l’objectif souhaité. Ces choix humains sont alors utilisés pour entraîner le prédicteur de récompenses, qui à son tour forme l’agent apprenant. En fin de compte, cet agent parvient à améliorer son comportement pour maximiser ses récompenses, en s’assurant de satisfaire les critères humains.

Systèmes d’IA plus sûrs

Cette approche permet aux humains de repérer et de corriger les comportements indésirables, garantissant ainsi une sécurité sans surcharger les opérateurs humains. C’est intéressant, car ils n’ont besoin d’examiner qu’environ 0,1 % du comportement de l’agent pour l’éduquer. Bien que cela puisse sembler minime, cela représente potentiellement des milliers de vidéos à revoir, un défi auquel les chercheurs s’attaquent.

Le retour d’information humain peut également permettre à l’IA d’atteindre des résultats surhumains, surtout dans les jeux vidéo. Les chercheurs étudient actuellement pourquoi le système de retour d’information humain produit des résultats exceptionnels pour certaines tâches, mais donne des résultats médiocres ou même inefficaces dans d’autres. Par exemple, il est apparu qu’aucune quantité de retour humain n’a réussi à aider le système à maîtriser des jeux comme Breakout ou Qbert. Les scientifiques essaient également de trouver des solutions au problème du piratage de récompenses, qui survient lorsque l’arrêt précoce du retour d’information humain incite le système à exploiter sa fonction de récompense pour obtenir de mauvaises performances.

Comprendre ces problématiques est crucial pour concevoir des systèmes d’IA qui se comportent comme nous les souhaitons : de manière sécurisée et efficace. Parmi les objectifs futurs, il pourrait y avoir une réduction du volume de retour humain nécessaire ou une modification de la manière de fournir ce retour ; peut-être qu’un jour des échanges “face à face” pourraient offrir à l’IA davantage d’opportunités pour apprendre directement des comportements humains.

Remarque de l’éditeur : cet article a été mis à jour pour intégrer les contributions d’OpenAI.

FAQ

Pourquoi le retour d’information humain est-il essentiel pour l’apprentissage de l’IA ?

Le retour d’information humain est crucial car il permet de guider l’apprentissage de l’IA en corrigeant les erreurs et en réduisant les risques associés à des comportements indésirables.

Quels types de tâches l’IA excelle-t-elle grâce au retour d’information humain ?

L’IA peut obtenir des résultats impressionnants dans certaines applications, comme les jeux vidéo, où des stratégies complexes peuvent être mieux maîtrisées grâce à une supervision humaine.

Quel est le défi principal lié à la dépendance au retour d’information humain ?

L’un des défis majeurs réside dans la délivrabilité du retour d’information : il est difficile de garantir que l’IA reste efficace si elle dépend trop d’une supervision humaine, surtout si celle-ci est interrompue.

Quelles sont les méthodes de contrôle mises en place pour assurer la sécurité des systèmes d’IA ?

Des techniques telles que l’apprentissage par renforcement, lorsqu’elles sont associées à des validations humaines fréquentes, sont employées pour surveiller et modifier les comportements des IA en temps réel.

En quoi le développement d’une IA éthique est-il important ?

Un développement éthique de l’IA est fondamental pour garantir que ces technologies aient un impact positif sur la société et qu’elles ne reproduisent pas les biais ou les injustices humaines.

Quitter la version mobile