基于策略预算的个性化强化学习
机器学习
2024-01-15 v1
摘要
机器学习中的个性化旨在使模型的决策适应用户的个体特征。尽管该方法在推荐系统等领域取得了成功,但其在医疗健康和自动驾驶等高风险领域的扩展受到广泛监管审批流程的制约。为应对这一挑战,我们提出了一种名为表征马尔可夫决策过程(r-MDPs)的新框架,旨在平衡个性化需求与监管约束。在 r-MDP 中,我们通过一组少量代表性策略与具有独特偏好的多样化用户群体进行交互。我们的目标有两个:高效地将每个用户匹配到合适的代表性策略,并同时优化这些策略以最大化整体社会福利。我们开发了两种深度强化学习算法来高效求解 r-MDPs。这些算法从经典 K-means 聚类的原理中汲取灵感,并建立在坚实的理论基础之上。我们在多种模拟环境中进行的实证研究表明,即使在有限的策略预算下,这些算法也能实现有意义的个性化。此外,它们还展现出可扩展性,能够高效地适应更大的策略预算。
引用
@article{arxiv.2401.06514,
title = {Personalized Reinforcement Learning with a Budget of Policies},
author = {Dmitry Ivanov and Omer Ben-Porat},
journal= {arXiv preprint arXiv:2401.06514},
year = {2024}
}
备注
Accepted to AAAI 2024. Code: https://github.com/dimonenka/RL_policy_budget