非马尔可夫决策过程下多任务强化学习的可证明收益
机器学习
2023-10-23 v1 机器学习
摘要
在马尔可夫决策过程(MDPs)下的多任务强化学习(RL)中,多个 MDP 之间共享的潜在结构已被证明相比单任务 RL 能显著提升样本效率。本文研究此类收益是否能推广到更一般的序列决策问题,如部分可观测 MDP(POMDPs)及更一般的预测状态表示(PSRs)。主要挑战在于庞大而复杂的模型空间使得难以确定多任务 PSRs 的哪些常见潜在结构能降低模型复杂度并提升样本效率。为此,我们为任务设定一个联合模型类,并利用 -bracketing number(-划分数)概念量化其复杂度;该数亦作为刻画任务相似性的通用度量,从而决定多任务相对单任务 RL 的收益。我们首先研究 PSRs 上的上游多任务学习,其中所有任务共享相同的观测与动作空间。我们提出一种可证明高效的算法 UMT-PSR 来为所有 PSRs 寻找近最优策略,并证明当 PSRs 的联合模型类的 -划分数小于各单任务学习时,多任务学习的优势得以显现。我们还给出若干具有较小 -划分数的多任务 PSR 示例,它们获益于多任务学习。我们进一步研究下游学习,其中智能体需通过相似性约束,学习一个与上游任务存在共性的新目标任务。通过利用上游已学得的 PSRs,我们开发了可证明找到近最优策略的样本高效算法。
引用
@article{arxiv.2310.13550,
title = {Provable Benefits of Multi-task RL under Non-Markovian Decision Making Processes},
author = {Ruiquan Huang and Yuan Cheng and Jing Yang and Vincent Tan and Yingbin Liang},
journal= {arXiv preprint arXiv:2310.13550},
year = {2023}
}