Intelligence Artificielle

L’IA de Google Réinvente la Parole Humaine avec une Précision Impressionnante.

L'IA de Google Réinvente la Parole Humaine avec une Précision Impressionnante.

Cours d’Élocution

L’année précédente, la société spécialisée dans la recherche en intelligence artificielle, DeepMind, a présenté WaveNet, un réseau de neurones profond capable de générer un discours humain réaliste. Récemment, une version améliorée de cette technologie a été déployée pour fonctionner avec Google Assistant.

Un système de synthèse vocale, souvent appelé texte-à-parole (TTS), fonctionne généralement grâce à deux techniques principales. La méthode concaténative consiste à assembler des morceaux d’enregistrements réalisés par un comédien vocal. Cependant, cette méthode a ses limites : chaque mise à jour ou changement de voix nécessite un remplacement complet des bibliothèques audio.

En revanche, la technique paramétrique s’appuie sur des paramètres pour produire un discours généré par ordinateur. Néanmoins, ce type de synthèse peut parfois donner un résultat qui semble peu naturel ou trop robotique.

L’innovation WaveNet

WaveNet se distingue, car il crée des formes d’onde à partir de zéro, en utilisant un réseau de neurones convolutif. Pour cela, une multitude d’échantillons vocaux a été utilisée afin d’affiner le système pour qu’il puisse imiter des voix crédibles. Grâce à cela, le synthétiseur vocal réussit à reproduire des intonations naturelles, y compris des détails comme les bruits de la bouche. En fonction des échantillons fournis, il peut développer un “accent” distinct, permettant ainsi de créer une grande variété de voix à partir de différents ensembles de données.

A lire :  Waymo : Un Chien Petit et Courageux Face à des Vandales entourant le Véhicule.

Améliorations Technologiques

La principale contrainte de WaveNet au départ était son besoin en puissance de calcul. Il était relativement lent, prenant une seconde pour générer seulement 0,02 seconde de son. Toutefois, après un an d’optimisations par les ingénieurs de DeepMind, WaveNet a gagné en efficacité. Désormais, il peut générer une forme d’onde d’une seconde en seulement 50 millisecondes, soit 1 000 fois plus rapide que sa version initiale. De plus, la résolution des échantillons est passée de 8 bits à 16 bits, ce qui a considérablement amélioré ses performances lors des tests effectués auprès d’auditeurs humains.

Ces progrès ouvrent la voie à l’intégration de cette technologie dans des produits destinés aux consommateurs, y compris Google Assistant qui utilise déjà la synthèse vocale en anglais américain et en japonais. Grâce à la flexibilité de WaveNet à créer des voix spécialisées, Google pourra potentiellement synthétiser un discours réaliste dans d’autres langues et dialectes à l’avenir.

L’utilisation croissante des interfaces vocales dans tous les domaines du numérique rend la synthèse vocale cruciale. Pourtant, le caractère mécanique de certaines voix synthétiques a rebuté de nombreux utilisateurs potentiels. Les efforts de DeepMind pour améliorer cette technologie pourraient favoriser son adoption à plus grande échelle et affiner l’expérience existante.

FAQ

Quel est le fonctionnement de WaveNet ?

WaveNet utilise un réseau de neurones convolutif pour créer des formes d’onde de voix humaines réalistes à partir de zéro, à la différence des méthodes de synthèse vocale classiques qui se basent sur des échantillons préenregistrés.

Quelles langues sont prises en charge par Google Assistant avec WaveNet ?

Actuellement, WaveNet permet de produire des voix en anglais américain et en japonais, mais des plans pour ajouter d’autres langues sont en cours.

A lire :  L'Avènement de l'Intelligence Artificielle : Trois Étapes Clés

Quels sont les avantages d’utiliser WaveNet par rapport aux autres systèmes TTS ?

WaveNet offre une écoute plus naturelle et expressive, avec de meilleures intonations et une articulation plus fluide, par rapport aux voix synthétiques souvent perçues comme robotiques.

Combien de temps faut-il pour générer de l’audio avec WaveNet ?

Après les dernières optimisations, WaveNet peut générer une seconde d’audio en seulement 50 millisecondes.

Où est utilisé WaveNet actuellement ?

WaveNet est déjà intégré dans Google Assistant et pourrait être appliqué à d’autres produits de consommation à l’avenir, grâce à sa capacité à synthétiser des voix réalistes.