L’impact de l’IA sur le contenu web
L’internet continue de subir une transformation inquiétante due à la présence croissante de contenus créés et traduits par l’intelligence artificielle (IA). D’après un rapport de Vice, une étude récente menée par des chercheurs du AWS AI Lab révèle que plus de la moitié – précisément 57,1 % – des phrases présentes en ligne sont désormais traduites dans deux langues ou plus, souvent avec une qualité très médiocre. Cette situation suggère que les modèles d’IA, comme les modèles de langage, sont utilisés non seulement pour générer du contenu en anglais, mais aussi pour le traduire dans d’autres langues, ce qui se traduit par une dégradation générale de la qualité.
Les chercheurs soulignent que ce phénomène est particulièrement alarmant dans les langues à ressources limitées. Cela signifie qu’il y a moins de données disponibles pour entraîner efficacement les modèles d’IA, rendant le problème encore plus critique.
La dégradation du contenu en ligne
En raison de la volonté des entreprises de maximiser leurs revenus publicitaires par le biais de contenus attirant les clics, l’IA génère des milliers de textes en anglais. Ces textes sont ensuite traduits en plusieurs autres langues, engendrant une multiplication des contenus de moindre qualité. Cela crée une véritable surabondance de traductions incohérentes, saturant des régions entières du web avec des copies particulièrement dégradées.
Les résultats de cette étude ne tarderont pas à être examinés par des pairs, mais le terme « choquant » semble tout à fait approprié pour décrire cette situation. En effet, les traductions automatiques prennent une place disproportionnée dans le contenu total disponible dans des langues moins courantes. Les chercheurs insistent sur le fait que ces traductions générées par des machines représentent une grande partie de l’ensemble du matériel disponible sur le web dans ces langues.
Théorie de l’Internet mort
Les avertissements concernant les dangers que représente l’IA pour l’utilité du web ne sont pas nouveaux. Par exemple, Google a déjà été confronté à des problèmes sérieux liés à la présence de contenu généré par l’IA dans ses résultats de recherche. Un récent rapport de 404 Media met en avant que même les algorithmes de Google News sont influencés par ces contenus non fiables. De même, Amazon a rencontré des difficultés similaires avec des milliers de listings de livres générés par l’IA, laissant transparaître des titres absurdes tels que « Je ne peux pas satisfaire cette demande car elle va à l’encontre des politiques d’utilisation d’OpenAI ».
Au-delà de ces plateformes spécifiques, de nombreuses études montrent que la prolifération de contenus générés par l’IA est une réalité omniprésente sur le web. Bien que la hiérarchisation actuelle soit préoccupante pour le contenu en anglais, elle est d’autant plus alarmante pour les utilisateurs de langues moins répandues.
Le plus inquiétant reste que la saturation du web par ces traductions incohérentes pourrait rendre quasiment impossible la formation de modèles d’IA efficaces pour ces langues. Les scientifiques de l’IA ont besoin de grandes quantités de données de qualité pour entraîner des modèles avancés, généralement en les récupérant sur le web. Si un domaine de l’internet est déjà submergé par des contenus sans aucun sens, l’opportunité de former des modèles puissants pour ces langues pourrait s’évaporer avant même de commencer.
FAQ
Quelles sont les principales langues touchées par ce phénomène?
Les langues à ressources limitées, telles que certaines langues africaines ou autochtones, sont particulièrement affectées, car elles manquent de données de haute qualité pour l’entraînement des modèles d’IA.
Comment peut-on améliorer la qualité du contenu généré par l’IA?
L’amélioration de la qualité passe par l’utilisation de modèles de langage plus sophistiqués et par des vérifications humaines rigoureuses des contenus générés.
Quels sont les impacts économiques de cette situation sur des plateformes comme Google et Amazon?
Ces entreprises pourraient voir leur crédit de confiance diminuer si elles continuent à dépendre d’un contenu de faible qualité, ce qui pourrait impacter négativement leurs revenus publicitaires et leur réputation.
Que peuvent faire les utilisateurs pour éviter le contenu de faible qualité?
Les utilisateurs peuvent signaler les contenus douteux et chercher des sources réputées pour leurs informations afin de contrer la propagation de fausses informations.
Quels sont les risques à long terme de la prolifération des contenus d’IA?
À long terme, cela pourrait entraîner une dévaluation de la qualité de l’information en ligne, rendant plus difficile la recherche d’informations fiables et précises.
