Intelligence Artificielle

Le Nouvel ChatGPT Affronte un Énorme Défi en Chinois

Le Nouvel ChatGPT Affronte un Énorme Défi en Chinois

Problèmes liés aux Données Polluées

OpenAI fait face à un problème majeur de pollution dans ses données d’entraînement, ce qui a conduit son nouveau chatbot à produire des réponses en chinois remplies de contenu inapproprié et de spam. Selon un article de la MIT Technology Review, les résultats en chinois sont remarquablement peu fiables.

La semaine dernière, OpenAI a présenté GPT-4o, un modèle de langage de grande taille avec des capacités avancées, comme la possibilité d’interagir en temps réel et de “voir” à travers les caméras des appareils des utilisateurs. Cependant, malgré ses nombreuses améliorations, il semble qu’il y ait un énorme souci concernant la langue chinoise.

Pour entraîner des modèles d’IA, il est essentiel d’utiliser des tokens, qui sont des unités de données représentant des informations que l’IA utilise pour apprendre. D’après la MIT Tech, les chercheurs en IA ont rapidement identifié que presque tous les 100 tokens chinois les plus longs utilisés pour déchiffrer les requêtes étaient remplis de contenu de spam et de porno. Cela a eu pour conséquence des réponses étranges, bourrées de contenu douteux, à des questions tout à fait ordinaires.

« C’est carrément ridicule », a commenté Tianle Cai, chercheur en IA et doctorant à Princeton, dans un message publié sur GitHub, où il a mis en avant les tokens pollués.

Une Erreur Évitée

Ce qui est le plus inquiétant, c’est que ce type de problème lié aux données sales est un obstacle bien connu dans l’entraînement des IA. Selon des spécialistes, il aurait été plutôt facile de remédier à cette situation. Deedy Das, un investisseur en IA chez Menlo Ventures qui a auparavant travaillé pour l’équipe de recherche de Google, a indiqué à la MIT Tech que chaque problème de spam dispose d’une solution. Il a suggéré qu’il suffisait d’auto-traduire le contenu tokenisé pour détecter certains mots-clés problématiques afin d’obtenir “60 % du chemin” vers un jeu de données propre.

« En fin de compte, je ne pense pas qu’ils aient réellement fait le travail dans ce cas-là », a-t-il ajouté.

Cai a également noté que les tokens en anglais semblent corrects, mais ceux en chinois ne le sont pas. Cela suggère que la principale raison de cette erreur d’OpenAI pourrait être que l’équipe n’a pas jugé utile de s’assurer que les tokens en chinois soient exempts de contenu indésirable.

Cela reflète mal sur OpenAI, d’autant plus que la langue chinoise possède le plus grand nombre de locuteurs natifs dans le monde. Si l’avenir de notre internet repose sur le contenu généré par l’IA plutôt que sur les sites et communautés créés par des humains, des erreurs comme celle-ci, qui laissent de côté plus d’un milliard de personnes, sont préoccupantes.

Il est préférable de considérer cela comme une occasion d’apprentissage pour améliorer les futurs développements de l’IA.

FAQ

Quelles mesures OpenAI pourrait-elle prendre pour corriger ses erreurs ?

OpenAI pourrait redoubler d’efforts pour nettoyer ses bases de données en veillant à ce que les contenus offensants soient identifiés et éliminés avant l’entraînement des modèles.

Comment la pollution des données peut-elle affecter les utilisateurs ?

La pollution des données peut mener à des réponses inappropriées ou peu fiables, ce qui impacte négativement l’expérience utilisateur et peut même semer la confusion.

Quelle est l’importance des tokens dans l’entraînement des IA ?

Les tokens jouent un rôle crucial dans l’apprentissage des IA, car ils représentent les données que le modèle utilise pour comprendre le langage et générer des réponses.

Quelles autres langues pourraient être affectées par ce type de problème ?

Tout modèle IA pourrait rencontrer des problèmes similaires avec d’autres langues si les données d’entraînement ne sont pas soigneusement vérifiées et nettoyées.

Comment les utilisateurs peuvent-ils signaler des problèmes avec un chatbot ?

Les utilisateurs peuvent généralement signaler des problèmes via des interfaces de retour d’expérience, souvent disponibles dans l’application ou sur le site web fourni par la plateforme.

Quitter la version mobile