S’inscrire à la Newsletter
Dans un monde en constante évolution, il est essentiel de rester informé des dernières avancées. Abonnez-vous pour découvrir aujourd’hui les innovations qui façonneront l’avenir !
Nous vous transmettrons des informations fascinantes sur les nouvelles technologies et les découvertes scientifiques qui ne doivent pas être ratées.
La Géolocalisation
Il est souvent possible de déterminer l’emplacement d’une photo en observant des indices visuels. Les monuments célèbres comme la Grande Muraille de Chine ou la Tour de Londres sont immédiatement reconnaissables. Cependant, que faire lorsque les photos ne contiennent pas d’indices géographiques évidents, comme celles de plats, d’animaux ou prises à l’intérieur ?
Les gens sont généralement assez bons pour identifier ces lieux en s’appuyant sur leurs connaissances du monde. Par exemple, il est possible de déduire l’emplacement d’une photo grâce aux inscriptions, aux styles architecturaux ou à la végétation présente.
Contrairement aux humains, qui sont naturellement capables de déterminer un lieu sur une image sans formation préalable, les machines rencontrent souvent des difficultés dans cette tâche.
Récemment, une équipe de Google a développé un système de deep learning capable de localiser des photos uniquement à partir des pixels, sans se fonder sur les données métadonnées. De plus, ils ont trouvé des méthodes intelligentes pour identifier des photos prises à l’intérieur ou sans indices de géolocalisation, une approche qui devrait susciter l’étonnement quant à son absence dans des travaux antérieurs.
PlaNet : Une Nouvelle Technologie
L’équipe dirigée par Tobias Weyand, un spécialiste de la vision par ordinateur, a utilisé une méthode relativement simple : ils ont segmenté le monde en grilles de 26 000 cases, chacune de tailles variées.
La taille de ces cases dépend du nombre de photos prises dans chaque zone. Par exemple, les grandes villes ont des cases plus petites et plus détaillées, car elles abritent de nombreuses photos, tandis que les zones reculées pourraient avoir des grilles moins détaillées en raison du faible nombre de clichés.
Par la suite, l’équipe a constitué une vaste base de données d’images géolocalisées, associant chaque image à sa case correspondante. Cette base contient 126 millions de photos, dont 91 millions ont servi à former un réseau neuronal pour identifier leur localisation, tandis que les 34 millions restantes ont permis de valider les résultats.
Ce réseau, baptisé PlaNet, a ensuite été mis à l’épreuve avec 2,3 millions d’images géolocalisées provenant de Flickr pour tester sa capacité à les reconnaître avec précision.
L’Homme contre la Machine
D’après Weyand et son équipe, PlaNet parvient à localiser environ 3,6 % des images avec une précision au niveau de la rue et jusqu’à 10,1 % au niveau de la ville. De plus, il a pu identifier le pays d’origine dans 28,4 % des photos et le continent dans 48 %.
Bien que ces résultats puissent sembler modestes, ils sont en réalité impressionnants. Pour illustrer cela, l’équipe a confronté PlaNet à 10 humains bien voyageant à travers un jeu en ligne. Dans ce jeu, une image aléatoire tirée de Google Street View était affichée, et les participants devaient identifier l’endroit d’où elle avait été prise. Vous pouvez tester vous-même votre capacité à localiser des images sur www.geoguessr.com.
Les résultats ont été étonnants : PlaNet a remporté 28 des 50 rounds, avec une erreur médiane de 1131,7 km, contre 2320,75 km pour les humains.
Weyand a déclaré : « Cette expérience démontre que PlaNet atteint une performance supérieure à celle des humains dans l’art de la géolocalisation. »
Bien que PlaNet ne dispose pas encore de la compréhension de la végétation ou de l’architecture, il bénéficie néanmoins d’un avantage : ayant “visité” plus d’endroits que quiconque ne pourrait jamais le faire, il a intégré des subtilités que même un voyageur aguerri aurait du mal à discerner.
Étonnamment, le modèle requiert peu d’espace mémoire : « Il utilise seulement 377 Mo, ce qui peut même tenir dans la mémoire d’un smartphone », a ajouté Weyand.
FAQ
Quelle est la principale différence entre PlaNet et un être humain pour la géolocalisation ?
PlaNet traite une quantité massive de données d’images et peut identifier des lieux à partir de détails subtils que la plupart des humains pourraient négliger, lui donnant un avantage.
Comment PlaNet est-il capable de comprendre des images sans métadonnées ?
PlaNet analyse uniquement les pixels de l’image et utilise des algorithmes d’apprentissage pour associer les caractéristiques visuelles à des emplacements spécifiques.
Est-il possible d’améliorer la précision de PlaNet ?
Oui, en continuant d’alimenter PlaNet avec plus d’images géolocalisées et en affinant les réseaux neuronaux, sa performance peut encore être améliorée.
Comment les entreprises peuvent-elles utiliser cette technologie ?
Les entreprises peuvent intégrer PlaNet dans des applications liées au tourisme, à la publicité et à l’analyse de données géographiques pour mieux comprendre le comportement des consommateurs et optimiser leurs stratégies.
Y a-t-il des préoccupations éthiques liées à l’utilisation de PlaNet ?
Oui, des questions sur la vie privée et l’utilisation des données personnelles peuvent se poser, surtout lorsqu’il s’agit de géolocalisation d’images prises par des individus.
