具有潜在低秩结构的迁移强化学习的极限
机器学习
2024-10-30 v1
摘要
由于问题的状态空间和动作空间规模 过大,许多强化学习 (RL) 算法在实际应用中成本过高。为解决此问题,我们研究了具有潜在低秩结构的迁移 RL。我们考虑在源 MDP 和目标 MDP 的转移核具有 Tucker 秩 、、 或 时,迁移潜在低秩表示的问题。在每种设定下,我们引入了迁移能力系数 以衡量表示迁移的难度。我们的算法在每个源 MDP 中学习潜在表示,随后利用线性结构消除目标 MDP 遗憾界中对 或 的依赖。我们用信息论下界补充了正面结果,表明我们的算法(不包括 设定)在 方面是极小极大最优的。
引用
@article{arxiv.2410.21601,
title = {The Limits of Transfer Reinforcement Learning with Latent Low-rank Structure},
author = {Tyler Sam and Yudong Chen and Christina Lee Yu},
journal= {arXiv preprint arXiv:2410.21601},
year = {2024}
}