面向复合马尔可夫决策过程的迁移转移 Q 学习
机器学习
2025-02-04 v1 机器学习
摘要
为弥合迁移强化学习(RL)中经验成功与理论理解之间的差距,我们研究了一种具有可证明性能保证的原则性方法。我们引入了一个新颖的复合 MDP 框架,其中高维转移动态被建模为一个表示共享结构的低秩分量与一个捕捉任务特定变化的稀疏分量之和。这放宽了纯低秩转移模型的常见假设,允许更现实的场景,即任务共享核心动态但保持个体差异。我们提出了 UCB-TQL(上置信界迁移 Q 学习),专为迁移 RL 场景设计,其中多个任务共享核心线性 MDP 动态,但沿稀疏维度分化。在源任务上训练足够轨迹后,将 UCB-TQL 应用于目标任务时,我们实现了 的遗憾界,该界与环境的维度无关。这里, 表示目标任务中的轨迹数量,而 量化了任务间的稀疏差异。这一结果通过有效利用任务间的结构相似性,展示了相对于单任务 RL 的显著改进。我们的理论分析为 UCB-TQL 如何同时利用共享动态并适应任务特定变化提供了严格的保证。
引用
@article{arxiv.2502.00534,
title = {Transition Transfer $Q$-Learning for Composite Markov Decision Processes},
author = {Jinhang Chai and Elynn Chen and Lin Yang},
journal= {arXiv preprint arXiv:2502.00534},
year = {2025}
}