Technologies du futur

Comment fonctionne un assistant vocal comme Siri ou Alexa ?

La réponse

Un assistant vocal comme Siri ou Alexa repose sur plusieurs étapes : il écoute les commandes grâce à un microphone, utilise des algorithmes de reconnaissance vocale pour comprendre la demande, puis active des services cloud pour traiter l’information et générer une réponse. Enfin, il restitue la réponse vocalement via un haut-parleur. Ces assistants s’améliorent constamment grâce à l’apprentissage automatique et à l’intelligence artificielle.

En savoir plus

Un assistant vocal comme Siri ou Alexa transforme une phrase prononcée en une action ou en une réponse audible. Pour y parvenir, il combine un microphone, des logiciels de détection et de reconnaissance de la parole, des systèmes capables d’interpréter la demande, ainsi que des services informatiques qui fournissent les informations nécessaires. Une partie du traitement peut être réalisée directement sur l’appareil, mais de nombreuses fonctions reposent aussi sur des serveurs distants accessibles par Internet.

De la parole à la commande

Le microphone capte les sons environnants. L’appareil dispose généralement d’un système de détection du mot d’activation, appelé wake word, par exemple « Alexa » ou « Dis Siri ». Cette détection est conçue pour fonctionner localement et reconnaître le signal qui indique que l’utilisateur s’adresse à l’assistant. Avant cette activation, l’appareil n’est pas censé traiter la conversation comme une commande complète, même si le microphone reste disponible pour repérer le mot déclencheur. Une fois celui-ci détecté, l’assistant capte la demande et la convertit en données numériques exploitables par ses logiciels.

Reconnaître et interpréter la demande

La reconnaissance automatique de la parole, ou speech-to-text, transforme ensuite le signal sonore en texte ou en une représentation équivalente. Des modèles d’apprentissage automatique analysent les sons pour identifier les mots prononcés, en tenant compte autant que possible du bruit, de la prononciation et des variations de voix. Cette transcription ne suffit toutefois pas à comprendre la demande. Un autre traitement, fondé sur la compréhension du langage, cherche l’intention de l’utilisateur et les informations importantes de la phrase. Dans « Quel temps fera-t-il demain à Paris ? », l’assistant doit ainsi repérer qu’il s’agit d’une demande météorologique, le lieu concerné et le moment demandé.

Interroger les services appropriés

Après avoir identifié l’intention, l’assistant choisit la fonction ou le service capable d’y répondre. Il peut consulter un service de prévisions météorologiques, lancer une musique, régler une alarme, contrôler un appareil connecté ou fournir une information provenant d’une base de données. Pour de nombreuses requêtes, l’enregistrement ou sa transcription sont transmis à des services cloud, où des systèmes plus puissants effectuent une partie de la reconnaissance et de l’interprétation. La réponse dépend alors de la connexion, du service demandé et des autorisations accordées à l’assistant. Certaines opérations simples peuvent néanmoins être traitées directement sur le téléphone ou l’enceinte.

Produire et vocaliser la réponse

Une fois l’action effectuée ou l’information obtenue, l’assistant prépare une réponse, souvent sous forme de texte. Un système de synthèse vocale, ou text-to-speech, convertit ensuite ce texte en signal audio, qui est diffusé par le haut-parleur de l’appareil. Le résultat peut être une phrase, une confirmation d’action, une musique ou une autre commande destinée à un équipement connecté. Les assistants contemporains s’appuient sur l’intelligence artificielle et l’apprentissage automatique pour améliorer progressivement la reconnaissance de la parole et l’interprétation des formulations. Cette évolution dépend toutefois des modèles utilisés, des données d’entraînement, des mises à jour et des réglages de confidentialité du service.

CultureG.org