不变策略学习:一种因果视角
机器学习
2022-09-23 v4 人工智能
机器学习
摘要
情境_bandit 与强化学习算法已成功应用于在线广告、推荐系统和动态定价等多种交互式学习系统。然而,它们尚未在医疗等高风险应用领域得到广泛采用。一个原因可能是现有方法假设底层机制是静态的,即在不同环境中不发生变化。但在许多现实系统中,机制会随环境发生偏移,这可能使静态环境假设失效。本文中,我们着眼于离线情境_bandit 框架,向解决环境偏移问题迈出一步。我们通过因果关系的视角看待环境偏移问题,并提出允许多环境底层机制变化的多环境情境_bandit。我们采用因果文献中的不变性概念,引入策略不变性的概念。我们认为策略不变性仅在存在未观测变量时才相关,并表明在此情况下,在适当假设下最优不变策略保证能跨环境泛化。我们的结果建立了因果、不变性与情境_bandit 之间的具体联系。
引用
@article{arxiv.2106.00808,
title = {Invariant Policy Learning: A Causal Perspective},
author = {Sorawit Saengkyongam and Nikolaj Thams and Jonas Peters and Niklas Pfister},
journal= {arXiv preprint arXiv:2106.00808},
year = {2022}
}