Les avancées de la reconnaissance vocale
Cette année, nous avons été témoins de la défaite d’un expert mondial du Go face à une intelligence artificielle (IA) lors d’une partie complexe. À présent, un nouveau défi se profile : les humains sont sur le point de perdre contre les machines dans un domaine excitant : la dactylographie.
Une technologie révolutionnaire
Des chercheurs de l’Université de Stanford et de l’Université de Washington ont mis au point un logiciel de reconnaissance vocale si performant qu’il surpasse les dactylographes humains en rapidité et en précision. Cette avancée provient d’une étude récente sur un programme innovant développé par le géant chinois de l’Internet, Baidu.
La vidéo ci-dessous illustre une expérience à Stanford où la reconnaissance vocale a prouvé qu’elle pouvait produire des textes plus rapidement que les doigts humains.
L’essor de Deep Speech
Deep Speech 2, le logiciel de reconnaissance vocale de Baidu, repose sur un réseau de neurones par apprentissage profond. Cela signifie que le programme s’améliore continuellement en analysant de vastes ensembles de données de discours authentique.
James Landay, professeur en informatique à Stanford et co-auteur de l’étude, a déclaré que, bien que la reconnaissance vocale ait été souvent annoncée comme une technologie prometteuse durant des décennies, elle n’avait jamais vraiment fonctionné de manière efficace. Cependant, ces dernières années, des progrès notables ont été réalisés, grâce aux big data et à l’apprentissage profond.
Une étude comparative
Pour évaluer l’efficacité de Deep Speech 2, une expérience a été menée avec 32 participants âgés de 19 à 32 ans. Les tests ont été effectués en anglais et en mandarin, dans lesquels les participants devaient prononcer puis taper des phrases courtes à l’aide d’un iPhone. Les phrases comprenaient des expressions simples comme « la physique et la chimie sont difficiles » ou « passe un bon week-end ».
Une moitié des sujets utilisait un clavier QWERTY, tandis que l’autre moitié testait le clavier Pinyin d’iOS. Les résultats ont montré que la machine avait dominé : en anglais, le logiciel de reconnaissance vocale était trois fois plus rapide et affichait un taux d’erreur de seulement 20,4 %. En mandarin, il était 2,8 fois plus rapide, avec un taux d’erreur ni plus ni moins de 63,4 % inférieur à celui observé lors de la saisie manuelle.
Perspectives d’avenir
Les chercheurs espèrent que ces progrès inciteront les ingénieurs à développer des interfaces qui tireront parti de cette technologie de reconnaissance vocale. Landay imagine un futur où l’on pourrait commencer une tâche par la voix, puis passer à une interface graphique à contrôler du bout des doigts.
FAQ
Qu’est-ce que Deep Speech 2 ?
Deep Speech 2 est un logiciel de reconnaissance vocale développé par Baidu, utilisant un réseau de neurones pour améliorer la précision grâce à l’analyse de grandes quantités de données.
Pourquoi les humains perdent-ils face à l’IA dans la dactylographie ?
L’évolution de la technologie de reconnaissance vocale a permis à l’IA de surpasser les capacités humaines en termes de rapidité et de précision dans la transcription de la parole.
Quelles applications pratiques peut avoir cette technologie ?
Cette technologie pourrait transformer de nombreux domaines, de l’assistance virtuelle à la transcription automatique, facilitant ainsi des interactions plus efficaces entre l’humain et la machine.
La reconnaissance vocale est-elle accessible dans d’autres langues ?
Oui, la reconnaissance vocale est en développement pour de nombreuses langues à travers le monde, bien que les résultats puissent varier selon les langues et les accents.
Quels sont les défis actuels de la reconnaissance vocale ?
Les défis incluent l’amélioration de la précision dans des environnements bruyants, la reconnaissance des accents variés et l’intégration fluide avec d’autres technologies.
