中文

具有潜在低秩结构的迁移强化学习的极限

机器学习 2024-10-30 v1

摘要

由于问题的状态空间和动作空间规模 S,AS, A 过大,许多强化学习 (RL) 算法在实际应用中成本过高。为解决此问题,我们研究了具有潜在低秩结构的迁移 RL。我们考虑在源 MDP 和目标 MDP 的转移核具有 Tucker 秩 (S,d,A)(S , d, A )(S,S,d)(S , S , d)(d,S,A)(d, S, A )(d,d,d)(d , d , d ) 时,迁移潜在低秩表示的问题。在每种设定下,我们引入了迁移能力系数 α\alpha 以衡量表示迁移的难度。我们的算法在每个源 MDP 中学习潜在表示,随后利用线性结构消除目标 MDP 遗憾界中对 S,AS, A SAS A 的依赖。我们用信息论下界补充了正面结果,表明我们的算法(不包括 (d,d,d)(d, d, d) 设定)在 α\alpha 方面是极小极大最优的。

关键词

引用

@article{arxiv.2410.21601,
  title  = {The Limits of Transfer Reinforcement Learning with Latent Low-rank Structure},
  author = {Tyler Sam and Yudong Chen and Christina Lee Yu},
  journal= {arXiv preprint arXiv:2410.21601},
  year   = {2024}
}