S’améliorer grâce à la télévision ?
Les chercheurs du Laboratoire d’Informatique et d’Intelligence Artificielle du MIT ont conçu un algorithme utilisant le deep learning. Cela permet à l’intelligence artificielle (IA) de décoder les interactions humaines pour anticiper les actions qui vont suivre. En alimentant le programme avec des vidéos représentant des interactions sociales humaines, ils ont évalué sa capacité à faire des prévisions.
Les expérimentateurs ont choisi une très large base de données : 600 heures de vidéos sur YouTube et de sitcoms comme The Office, Desperate Housewives et Scrubs. Bien que le choix des vidéos puisse sembler peu conventionnel, Carl Vondrick, un doctorant et chercheur impliqué dans le projet, explique qu’on a cherché des contenus accessibles et réalistes pour simuler des situations de la vie quotidienne.
« Nous avons voulu utiliser des vidéos aléatoires de YouTube, » déclare Vondrick. « La télévision nous a permis d’accéder facilement à ces données, tout en reflétant assez bien des scenarios réels. »
Les chercheurs ont montré à l’ordinateur des séquences où des personnes étaient à une seconde d’effectuer l’une des quatre actions suivantes : embrasser, serrer les mains, s’enlacer ou se donner un high-five. Dans cet exercice, l’IA a eu un taux de prédiction correct de 43%, alors que les humains ont réussi à prévoir avec un taux de 71%.
Algorithmes de Prédiction d’Actions
Un futur potentiel
Développer la capacité de l’IA à interpréter les visuels de manière similaire aux humains pourrait ouvrir la voie à des assistants domestiques efficaces et à des caméras de sécurité intelligentes capables d’appeler les secours avant qu’une situation ne dégénère.
Bien que ce ne soit pas le premier effort en matière de prédiction vidéo, cette recherche se distingue par sa précision sans précédent. En effet, l’algorithme récent s’éloigne des méthodologies antérieures qui privilégiaient les représentations pixel par pixel. Il repose sur des représentations abstraites et se concentre sur des signaux clés : il apprend indépendamment et utilise des « représentations visuelles » pour différencier les indices visuels importants des interactions sociales de ceux qui ne le sont pas. Cette compétence est naturelle chez l’homme mais constitue un défi complexe pour l’IA.
Pedro Domingos, un expert en apprentissage machine à l’Université de Washington, souligne que, bien que des recherches similaires aient été menées précédemment, les résultats obtenus dans ce projet surpassent largement ceux de ces tentatives.
FAQ
Qu’est-ce que le deep learning ?
Le deep learning est une sous-catégorie de l’apprentissage machine qui utilise des réseaux de neurones pour traiter des données, permettant ainsi à une machine d’apprendre et d’imiter des comportements complexes.
Quels sont les avantages d’utiliser des vidéos pour l’apprentissage d’une IA ?
Les vidéos offrent une perspective riche et variée des interactions humaines, ce qui permet à l’IA de mieux comprendre et analyser des comportements dans des contextes qu’elle pourrait rencontrer dans la réalité.
Comment les vidéos ont-elles été sélectionnées pour les recherches ?
Les chercheurs ont principalement choisi des vidéos de YouTube et de séries télévisées populaires qui représentent des scènes de la vie quotidienne afin d’offrir un contenu facilement accessible.
Quelle est l’importance de la reconnaissance des actions humaines pour l’IA ?
Comprendre et anticiper les actions humaines peut améliorer les interactions homme-machine et contribuer à des développements technologiques dans des domaines comme la robotique et la sécurité publique.
L’IA peut-elle surpasser l’intuition humaine ?
Actuellement, l’IA objectif de prédiction surpasse certaines tâches spécifiques, mais elle n’atteint pas encore la compréhension ou l’intuition humaine, qui inclut des émotions et des contextes sociaux complexes.
