Intelligence Artificielle

Personne ne veut qu’Apple explore ses sites Web pour former ses IA

Personne ne veut qu'Apple explore ses sites Web pour former ses IA

Image : Ying Tang / NurPhoto via Getty / Futurism

## Panneau d’Arrêt

Les nouvelles de Wired indiquent qu’un certain nombre de grands sites web, y compris des éditeurs d’actualités reconnus et des plateformes de médias sociaux populaires, empêchent le robot d’exploration d’Apple d’accéder à leurs pages pour collecter des contenus destinés à l’entraînement de l’IA.

D’après cette enquête, des entreprises médiatiques comme The New York Times, The Atlantic, The Financial Times, Gannett, Vox Media et Condé Nast ont modifié leurs fichiers robots.txt pour interdire l’accès à Applebot. Du côté des réseaux sociaux, Facebook, Instagram et Tumblr ont tous confirmé qu’ils ont bloqué les tentatives d’Apple d’explorer leurs sites. Même Craigslist, un pilier d’Internet, a pris les mêmes mesures.

Les fichiers robots.txt deviennent de plus en plus importants pour étudier les dynamique numériques de l’IA. Certaines de ces entreprises, dont Vox et Condé Nast, ont signé des accords de licence de contenu avec OpenAI. En revanche, The New York Times a adopté une position fermement opposée à l’IA et mène actuellement une action en justice contre OpenAI pour violation des droits d’auteur. Facebook et Instagram appartiennent à Meta, concurrent direct d’Apple dans le secteur de l’IA, tandis que des plateformes comme Tumblr et Craigslist détiennent des ensembles de données précieux. Dans ce contexte, Apple a déjà conclu un partenariat avec OpenAI pour intégrer le chatbot ChatGPT dans ses produits.

La compétition dans le secteur de l’IA est extrêmement féroce, surtout en ce qui concerne l’accès à des matériaux d’entraînement de haute qualité. Les relations délicates entre les entreprises d’IA et les organismes de presse ou les sites de médias sociaux se développent. Cela soulève des questions intéressantes sur permissions accordées aux robots d’exploration, tant du côté des éditeurs que des entreprises d’IA.

Mines de Charbon

D’après Wired, les sites mentionnés bloquent spécifiquement la version “Apple-Extended” de leur robot d’exploration, qui, selon un article de blog d’Apple, offre aux éditeurs la possibilité de refuser que leurs contenus soient utilisés pour l’entraînement des modèles d’IA d’Apple, y compris dans des expériences comme Siri et Spotlight. Un représentant d’Apple a confirmé que ce blocage n’empêche pas le robot d’exploration original de scanner le site, mais cela empêche que les données collectées soient utilisées pour les modèles d’IA d’Apple.

A lire :  Les Data Centers Spatiaux : Une Malédiction Inattendue

En revanche, Applebot collecte des informations pour Siri et Spotlight. Cette distinction traduit une certaine prudence d’Apple concernant la protection des droits d’auteur et de propriété intellectuelle à l’ère de l’IA.

The New York Times ne représente pas le seul acteur en train de poursuivre les créateurs d’IA. Il pourrait être dans le meilleur intérêt d’Apple d’éviter de collecter des données controversées ou faisant l’objet de litiges, surtout si la société a déjà fait appel à OpenAI pour combler certaines lacunes dans ses produits. On pourrait le considérer comme l’« indicateur en danger » dans la mine de charbon.

En savoir plus sur l’IA et les droits d’auteur : Au milieu du procès du New York Times, ChatGPT cite des versions plagiées d’articles du NYT sur une plateforme de contenu arménien.

FAQ

Quelle est la fonction principale du fichier robots.txt ?

Le fichier robots.txt permet aux propriétaires de sites web de contrôler l’accès des robots d’exploration des moteurs de recherche à leurs pages. Cela leur permet de protéger leurs contenus contre l’exploration non autorisée.

Qu’est-ce qu’Applebot ?

Applebot est le robot d’exploration web d’Apple, utilisé pour recueillir des données afin d’améliorer des services comme Siri et Spotlight.

Pourquoi certaines entreprises bloquent-elles Applebot ?

Elles cherchent à protéger leur contenu de l’exploitation par des modèles d’IA, en réponse à des préoccupations concernant les droits d’auteur et la manière dont leurs données peuvent être utilisées.

Quelle est l’importance de l’accès aux données d’entraînement pour les entreprises d’IA ?

L’accès à des données de haute qualité est crucial pour le développement efficace des modèles d’IA, car cela influence la performance et la précision des systèmes.

A lire :  Acteurs Vocaux Indignés par l'Utilisation de la Synthèse Vocale dans les Nouveaux Jeux Vidéo

Quels sont les risques liés à la collecte de données sur des sites bloquant Applebot ?

Collecter des données sur des sites bloqués pourrait entraîner des poursuites judiciaires pour violation des droits d’auteur, ce qui pourrait nuire à la réputation et aux finances de l’entreprise impliquée.