具有低秩奖励的多用户强化学习
机器学习
2023-05-23 v2 最优化与控制
摘要
在本工作中,我们考虑协作式多用户强化学习问题。在该设定中,多个用户具有相同的状态-动作空间和转移概率,但具有不同的奖励。在假设 个用户的奖励矩阵具有低秩结构(这是离线协同过滤设定中一个标准且在实践中成功的假设)的前提下,问题是:我们能否设计出与为每个用户单独学习 MDP 相比样本复杂度显著更低的算法。我们的主要贡献是一种算法,它与 个特定于用户的 MDP 协同探索奖励,并能在两种关键设定下高效学习奖励:表格 MDP 和线性 MDP。当 很大且秩为常数时,每个 MDP 的样本复杂度对状态空间大小呈对数依赖,与标准的“非协作”算法相比,这代表了在状态空间大小上的指数级降低。
引用
@article{arxiv.2210.05355,
title = {Multi-User Reinforcement Learning with Low Rank Rewards},
author = {Naman Agarwal and Prateek Jain and Suhas Kowshik and Dheeraj Nagaraj and Praneeth Netrapalli},
journal= {arXiv preprint arXiv:2210.05355},
year = {2023}
}