Qu'est-ce qu'un algorithme d'apprentissage automatique ?
La réponse
En savoir plus
Un algorithme d’apprentissage automatique est un programme informatique capable d’exploiter des données pour apprendre à réaliser une tâche. Au lieu de reposer uniquement sur une liste de règles écrites à l’avance pour chaque situation, il utilise une méthode d’apprentissage qui lui permet d’ajuster son fonctionnement à partir d’exemples ou d’observations. Il peut ainsi reconnaître des motifs dans les données, produire des prédictions ou prendre certaines décisions. Les filtres anti-spam, la reconnaissance d’images et certains systèmes de recommandation s’appuient sur ce principe, avec des résultats qui dépendent fortement des données utilisées et de la manière dont le système a été conçu.
Un apprentissage fondé sur les données
L’algorithme d’apprentissage automatique s’appuie généralement sur un modèle mathématique comportant des paramètres ajustables. Pendant la phase d’entraînement, il traite des données et modifie ces paramètres afin d’améliorer une mesure de performance, par exemple en réduisant l’écart entre ses prédictions et les résultats attendus. Les règles générales de cet ajustement sont programmées par les concepteurs, mais les valeurs précises permettant au modèle de repérer les régularités sont apprises à partir des données. Le modèle obtenu peut ensuite être utilisé sur de nouvelles données, à condition que celles-ci soient suffisamment comparables à celles rencontrées pendant l’apprentissage.
De l’identification de motifs à la prédiction
Les motifs recherchés peuvent prendre des formes diverses. Une régression peut servir à estimer une valeur, comme un prix ou une quantité, tandis qu’un algorithme de classification peut attribuer une catégorie à une observation, par exemple distinguer un message indésirable d’un message normal. D’autres méthodes cherchent à regrouper des données qui se ressemblent ou à représenter des relations complexes entre variables. Les arbres de décision, les modèles de régression et les réseaux de neurones font partie des familles de modèles susceptibles d’être utilisées. Dans tous les cas, l’objectif n’est pas de comprendre les données comme le ferait un être humain, mais d’exploiter des régularités statistiques pour obtenir un résultat utile.
Trois grandes formes d’apprentissage
Dans l’apprentissage supervisé, l’algorithme reçoit des exemples associés à une réponse connue. Il peut alors apprendre à prédire cette réponse pour de nouveaux cas, comme dans la classification ou la prévision. L’apprentissage non supervisé utilise des données dépourvues d’étiquettes fournissant la réponse attendue ; il cherche notamment à faire apparaître des regroupements ou des structures. L’apprentissage par renforcement repose quant à lui sur un agent qui interagit avec un environnement et reçoit des récompenses ou des pénalités selon les actions choisies. Ces catégories décrivent des modes d’apprentissage différents, même si certains systèmes modernes peuvent combiner plusieurs approches.
Une performance à vérifier
Un algorithme d’apprentissage automatique ne devient pas nécessairement plus performant simplement parce qu’il reçoit davantage de données, et un système déployé ne s’améliore pas automatiquement en continu. La qualité, la représentativité et la pertinence des données sont essentielles : des données incomplètes ou biaisées peuvent conduire à des résultats inexacts ou injustes. Il faut également évaluer le modèle sur des données distinctes de celles qui ont servi à l’entraîner, afin de vérifier sa capacité à généraliser. Un modèle peut en effet être victime de surapprentissage s’il mémorise trop précisément les exemples d’entraînement, ou de sous-apprentissage s’il est trop simple pour saisir les régularités importantes. L’apprentissage automatique fournit donc un moyen puissant de construire des prédictions et des décisions à partir de données, mais il ne dispense ni de contrôles ni d’une interprétation prudente de ses résultats.
