Intelligence Artificielle

Lancement de Google Cloud Vision : Une Révolution dans la Vision Machine

Lancement de Google Cloud Vision : Une Révolution dans la Vision Machine

Nouveautés de la Cloud Vision

Cette semaine, Google a annoncé l’arrivée de Cloud Vision, une technologie de reconnaissance d’images accessible aux développeurs. Actuellement, cette API est lancée en version limitée via le Google Cloud Platform.

Reconnaissance d’Images

La technologie de Google en matière de reconnaissance d’images est parmi les plus avancées, avec des applications diverses telles que la reconnaissance d’écriture (OCR), la détection de visages et l’identification d’objets. Auparavant, Google avait proposé sa Prediction API sans support d’images. Avec Cloud Vision, l’entreprise rentre en concurrence sur le marché des services de cloud public, aux côtés d’Amazon Web Services et de Microsoft avec son projet Oxford.

Dans un communiqué, Ram Ramanathan, chef de produit chez Google, a expliqué que les avancées en apprentissage automatique grâce à des plateformes comme TensorFlow ont permis de créer des modèles capables d’apprendre et de prédire le contenu des images. L’API Cloud Vision, actuellement en aperçu limité, offre une interface REST simple à utiliser. Les développeurs peuvent s’inscrire pour cette version bêta à l’adresse suivante : ici.

Fonctionnalités Clés de Cloud Vision

Selon Google, la Cloud Vision API propose plusieurs fonctionnalités qui peuvent être appliquées de manière combinée sur une image, notamment :

  • Détection d’Étiquettes/Entités : Cette fonctionnalité identifie l’entité principale dans l’image (par exemple, une voiture ou un chat) parmi une vaste catégorie d’objets. Cela permet de créer des métadonnées pour les catalogues d’images, facilitant ainsi des recherches ou des recommandations basées sur les images.

  • Reconnaissance Optique de Caractères : Cette option permet d’extraire du texte à partir d’une image, offrant une identification automatique des langues et prenant en charge une multitude de langues.

  • Détection de Contenu Inapproprié : Grâce à Google SafeSearch, cette fonction identifie les contenus inappropriés, facilitant ainsi la modération des contenus générés par les utilisateurs.

  • Détection de Visages : Elle peut repérer les visages dans des photos, en déterminant les caractéristiques faciales associées, telles que la position des yeux, du nez et de la bouche ainsi que l’évaluation de plus de huit émotions comme la joie ou la tristesse. Notons que Google ne pratique pas la reconnaissance faciale et ne conserve pas les données de détection sur ses serveurs.

  • Détection de Monuments : Cette fonctionnalité est capable d’identifier des structures célèbres, tant naturelles qu’artificielles, ainsi que leur latitude et longitude.

  • Détection de Logos : Elle permet d’identifier les logos de produits dans une image, l’API retournant alors le logo avec un encadré de délimitation propre.

A lire :  L’intelligence artificielle : une évolution sécurisée selon le PDG de Nvidia face à Joe Rogan

FAQ

Quels types d’images peuvent être analysés avec Cloud Vision ?

La Cloud Vision API peut analyser divers types d’images, allant des photos prises avec un smartphone aux images digitales extraites de différentes sources.

Y a-t-il des limites à l’utilisation de l’API ?

Oui, l’accès à l’API est en version limitée pour l’instant, ce qui signifie qu’il pourrait y avoir des restrictions sur le nombre d’analyses que vous pouvez effectuer.

Comment l’API traite-t-elle la confidentialité des images ?

Google assure que les informations de détection ne sont pas stockées sur ses serveurs, renforçant ainsi la sécurité et la confidentialité des données des utilisateurs.

Quelles industries peuvent bénéficier de cette technologie ?

Des secteurs tels que le commerce de détail, le marketing, et même la sécurité peuvent trouver des applications au sein de cette technologie pour améliorer leurs services et produits.

Existe-t-il un coût associé à l’utilisation de l’API Cloud Vision ?

Une tarification est prévue une fois que l’API sera entièrement lancée, mais les détails spécifiques seront publiés par Google ultérieurement.