Comment fonctionne un assistant vocal comme Siri ou Alexa ?
La réponse
En savoir plus
Un assistant vocal comme Siri ou Alexa transforme une phrase prononcée en une action ou en une réponse audible. Pour y parvenir, il combine un microphone, des logiciels de détection et de reconnaissance de la parole, des systèmes capables d’interpréter la demande, ainsi que des services informatiques qui fournissent les informations nécessaires. Une partie du traitement peut être réalisée directement sur l’appareil, mais de nombreuses fonctions reposent aussi sur des serveurs distants accessibles par Internet.
De la parole à la commande
Le microphone capte les sons environnants. L’appareil dispose généralement d’un système de détection du mot d’activation, appelé wake word, par exemple « Alexa » ou « Dis Siri ». Cette détection est conçue pour fonctionner localement et reconnaître le signal qui indique que l’utilisateur s’adresse à l’assistant. Avant cette activation, l’appareil n’est pas censé traiter la conversation comme une commande complète, même si le microphone reste disponible pour repérer le mot déclencheur. Une fois celui-ci détecté, l’assistant capte la demande et la convertit en données numériques exploitables par ses logiciels.
Reconnaître et interpréter la demande
La reconnaissance automatique de la parole, ou speech-to-text, transforme ensuite le signal sonore en texte ou en une représentation équivalente. Des modèles d’apprentissage automatique analysent les sons pour identifier les mots prononcés, en tenant compte autant que possible du bruit, de la prononciation et des variations de voix. Cette transcription ne suffit toutefois pas à comprendre la demande. Un autre traitement, fondé sur la compréhension du langage, cherche l’intention de l’utilisateur et les informations importantes de la phrase. Dans « Quel temps fera-t-il demain à Paris ? », l’assistant doit ainsi repérer qu’il s’agit d’une demande météorologique, le lieu concerné et le moment demandé.
Interroger les services appropriés
Après avoir identifié l’intention, l’assistant choisit la fonction ou le service capable d’y répondre. Il peut consulter un service de prévisions météorologiques, lancer une musique, régler une alarme, contrôler un appareil connecté ou fournir une information provenant d’une base de données. Pour de nombreuses requêtes, l’enregistrement ou sa transcription sont transmis à des services cloud, où des systèmes plus puissants effectuent une partie de la reconnaissance et de l’interprétation. La réponse dépend alors de la connexion, du service demandé et des autorisations accordées à l’assistant. Certaines opérations simples peuvent néanmoins être traitées directement sur le téléphone ou l’enceinte.
Produire et vocaliser la réponse
Une fois l’action effectuée ou l’information obtenue, l’assistant prépare une réponse, souvent sous forme de texte. Un système de synthèse vocale, ou text-to-speech, convertit ensuite ce texte en signal audio, qui est diffusé par le haut-parleur de l’appareil. Le résultat peut être une phrase, une confirmation d’action, une musique ou une autre commande destinée à un équipement connecté. Les assistants contemporains s’appuient sur l’intelligence artificielle et l’apprentissage automatique pour améliorer progressivement la reconnaissance de la parole et l’interprétation des formulations. Cette évolution dépend toutefois des modèles utilisés, des données d’entraînement, des mises à jour et des réglages de confidentialité du service.
