强化学习中多任务表示学习的可证明收益
机器学习
2022-06-14 v1 机器学习
摘要
随着表示学习成为实践中降低强化学习(RL)样本复杂度的有力技术,对其优势的理论理解仍然有限。在本文中,我们在低秩马尔可夫决策过程(MDP)模型下从理论上刻画了表示学习的收益。我们首先研究多任务低秩RL(作为上游训练),其中所有任务共享一个公共表示,并提出一种称为REFUEL的新的多任务无奖励算法。REFUEL学习每个任务的转移核和近最优策略,并为下游任务输出良好学习的表示。我们的结果表明,只要任务总数超过某一阈值,多任务表示学习在样本效率上可证明优于单独学习每个任务。接着我们研究在线与离线设置下的下游RL,其中智能体被分配一个与上游任务共享相同表示的新任务。对于在线和离线设置,我们均开发了样本高效算法,并表明其能找到近最优策略,其次优性差距由上游中学习表示的估计误差与随下游样本数增大而消失的项之和界定。我们的在线与离线RL下游结果进一步捕捉了利用上游学习表示、而非直接学习低秩模型表示所带来的收益。据我们所知,这是首个在基于探索的无奖励多任务RL中刻画上游与下游任务表示学习收益的理论研究。
引用
@article{arxiv.2206.05900,
title = {Provable Benefit of Multitask Representation Learning in Reinforcement Learning},
author = {Yuan Cheng and Songtao Feng and Jing Yang and Hong Zhang and Yingbin Liang},
journal= {arXiv preprint arXiv:2206.05900},
year = {2022}
}
备注
Submitted for publication