论预训练在强化学习泛化中的威力:可证明的益处与困难
机器学习
2023-06-30 v2
摘要
强化学习(RL)中的泛化旨在训练期间学习一个能泛化到目标环境的智能体。本文从理论层面研究 RL 泛化:我们可期望在训练环境上的预训练有多大帮助?当不允许与目标环境交互时,我们证明所能获得的最好结果是在平均意义下的近最优策略,并设计了实现该目标的算法。此外,当允许智能体与目标环境交互时,我们给出一个令人惊讶的结果,表明渐近意义上预训练带来的改进至多是一个常数因子。另一方面,在非渐近情形下,我们设计了一种高效算法,并证明了目标环境中与状态-动作空间无关的基于分布的 regret bound(后悔界)。
引用
@article{arxiv.2210.10464,
title = {On the Power of Pre-training for Generalization in RL: Provable Benefits and Hardness},
author = {Haotian Ye and Xiaoyu Chen and Liwei Wang and Simon S. Du},
journal= {arXiv preprint arXiv:2210.10464},
year = {2023}
}