Off-Policy Learning
Off-Policy Learning est un paradigme fondamental de l’apprentissage par renforcement (Reinforcement Learning – RL) où un agent apprend la valeur ou la politique optimale (la politique cible) en utilisant des données générées par une politique différente (la politique comportementale). En d’autres termes, l’agent apprend sur une politique « cible » π tout en suivant une politique « comportementale » μ pour interagir avec l’environnement et collecter des expériences.
Les concepts fondamentaux de l’Off-Policy Learning reposent sur la distinction entre la politique que l’agent cherche à évaluer ou à améliorer (la politique cible, π) et la politique que l’agent utilise effectivement pour générer des trajectoires d’expérience (la politique comportementale, μ). La politique cible est souvent déterministe et gourmande par rapport aux estimations de valeur actuelles (par exemple, choisir l’action ayant la plus grande valeur Q estimée), visant l’optimalité. La politique comportementale, en revanche, est généralement stochastique et exploratoire (par exemple, une politique epsilon-greedy), conçue pour assurer une exploration suffisante de l’espace états-actions afin de découvrir potentiellement de meilleures actions. Le défi majeur de l’apprentissage off-policy est que les données collectées sous μ ne reflètent pas directement ce qui se passerait si la politique cible π était suivie. Pour corriger ce décalage de distribution, les méthodes off-policy utilisent principalement une technique appelée Importance Sampling (Échantillonnage Pondéré). L’Importance Sampling réévalue l’importance des transitions ou des retours observés en les pondérant par le ratio des probabilités d’occurrence de l’action observée sous la politique cible par rapport à la politique comportementale (π(a|s) / μ(a|s)). Cette pondération permet d’estimer la valeur de la politique cible en utilisant des données provenant de la politique comportementale. Des algorithmes classiques comme Q-learning sont intrinsèquement off-policy car ils mettent à jour la valeur Q de l’action optimale estimée, indépendamment de l’action réellement choisie par la politique comportementale.
L’importance de l’Off-Policy Learning réside principalement dans sa capacité à améliorer l’efficacité des données et à découpler l’exploration de l’exploitation. En permettant l’apprentissage à partir de données générées par n’importe quelle politique, y compris des politiques antérieures, des démonstrations humaines, ou même des politiques exploratoires aléatoires, il permet de réutiliser des expériences passées. Ceci est crucial dans des domaines où la collecte de nouvelles données est coûteuse, dangereuse ou prend du temps, comme en robotique ou dans les systèmes médicaux. Le découplage exploration/exploitation permet à l’agent d’explorer l’environnement de manière approfondie en utilisant une politique comportementale sûre ou diversifiée, tout en apprenant simultanément une politique cible potentiellement beaucoup plus performante ou risquée. Cela ouvre la voie à l’apprentissage à partir de données fixes (batch RL ou offline RL), où l’agent apprend uniquement à partir d’un jeu de données préexistantes sans interaction supplémentaire avec l’environnement.
Les applications pratiques de l’Off-Policy Learning sont nombreuses. En robotique, un robot peut apprendre une politique de manipulation optimale en utilisant des données collectées lors d’essais antérieurs avec des politiques plus prudentes ou exploratoires. Dans les systèmes de recommandation, les algorithmes off-policy peuvent évaluer l’efficacité potentielle d’une nouvelle politique de recommandation en utilisant les logs d’interactions passées des utilisateurs (clics, achats) générés par une ancienne politique. En conduite autonome, il est possible d’apprendre des politiques de conduite à partir de grandes quantités de données enregistrées par des conducteurs humains ou d’autres politiques de conduite. Dans le domaine des jeux vidéo, l’algorithme Q-learning et ses variantes profondes comme Deep Q-Networks (DQN) sont des exemples emblématiques d’apprentissage off-policy, où l’agent apprend la politique optimale tout en utilisant une politique epsilon-greedy pour explorer l’espace de jeu. Le traitement de données de santé pour déterminer des séquences de traitement optimales à partir de dossiers médicaux historiques est une autre application potentielle importante.
Il existe des nuances dans l’apprentissage off-policy. On distingue souvent l’évaluation off-policy (Off-Policy Evaluation – OPE), qui vise à estimer la performance d’une politique cible donnée à partir de données comportementales, et le contrôle off-policy, qui vise à trouver la politique cible optimale. Les techniques d’Importance Sampling elles-mêmes ont des variantes, comme l’Ordinary Importance Sampling (OIS) et le Weighted Importance Sampling (WIS), qui diffèrent par la manière dont les poids sont normalisés et présentent des compromis différents en termes de biais et de variance. La variance élevée de l’Importance Sampling, surtout sur de longues trajectoires ou lorsque les politiques cible et comportementale sont très différentes, est un défi majeur. Des techniques comme le clipping des ratios d’importance ou l’utilisation de fonctions de valeur marginalisées sont utilisées pour atténuer ce problème. De plus, la combinaison de l’apprentissage off-policy, du bootstrapping (mise à jour des estimations basées sur d’autres estimations, comme dans le TD learning) et de l’approximation de fonction (utilisation de réseaux neuronaux, par exemple) peut conduire à une instabilité de l’apprentissage, un problème connu sous le nom de « triade mortelle » (deadly triad).
Plusieurs concepts sont étroitement liés à l’Off-Policy Learning. Son antonyme direct est l’On-Policy Learning, où la politique apprise et la politique utilisée pour générer les données sont les mêmes (ou très proches). Des algorithmes comme SARSA ou Policy Gradient (version on-policy comme REINFORCE) sont des exemples d’apprentissage on-policy. L’Importance Sampling est une technique statistique fondamentale utilisée dans de nombreuses méthodes off-policy. L’Experience Replay, une technique popularisée par DQN où les expériences passées sont stockées dans un tampon et rééchantillonnées pour les mises à jour, est fortement associée aux méthodes off-policy car elle permet de réutiliser des données collectées sous des versions antérieures de la politique. L’Offline Reinforcement Learning est un cas particulier de l’apprentissage off-policy où l’apprentissage se fait exclusivement à partir d’un jeu de données fixe sans interaction supplémentaire. D’autres termes pertinents incluent : politique (policy), fonction de valeur (value function), fonction Q (Q-function), processus décisionnel markovien (Markov Decision Process – MDP), exploration vs exploitation, et apprentissage par différence temporelle (Temporal Difference – TD learning).
Historiquement, l’idée d’apprendre sur une politique différente de celle suivie trouve ses racines dans les travaux sur le contrôle adaptatif et l’apprentissage par renforcement. L’algorithme Q-learning, introduit par Chris Watkins en 1989, est l’un des premiers et des plus influents algorithmes d’apprentissage par renforcement off-policy. Il a jeté les bases de nombreuses avancées ultérieures. L’Importance Sampling provient du domaine des statistiques et des méthodes de Monte Carlo. La combinaison de l’apprentissage off-policy avec des approximateurs de fonction puissants comme les réseaux neuronaux profonds (Deep RL), notamment avec DQN en 2013-2015, a conduit à des succès spectaculaires et a ravivé l’intérêt pour ces méthodes. Plus récemment, l’accent s’est fortement porté sur l’Offline RL, qui repose entièrement sur les principes de l’apprentissage off-policy.
Les avantages de l’Off-Policy Learning incluent principalement une meilleure efficacité des données grâce à la réutilisation de l’expérience, la capacité d’apprendre à partir de démonstrations ou de logs historiques, et la flexibilité de pouvoir utiliser des politiques comportementales distinctes pour l’exploration (potentiellement plus sûres ou plus diversifiées) tout en apprenant une politique cible optimale. Cependant, l’apprentissage off-policy présente aussi des inconvénients et des défis. Le principal est la variance potentiellement élevée des estimations, en particulier lors de l’utilisation de l’Importance Sampling avec des politiques cible et comportementale très différentes ou sur de longues séquences. Cela peut ralentir la convergence ou même la rendre instable. Les algorithmes off-policy peuvent être plus sensibles aux hyperparamètres que leurs homologues on-policy. La « triade mortelle » (off-policy + bootstrapping + approximation de fonction) peut entraîner une divergence des estimations de valeur si elle n’est pas gérée avec soin par des techniques de stabilisation spécifiques. L’évaluation précise de la performance des politiques apprises off-policy (OPE) reste un domaine de recherche actif en raison de ces défis.