中文

多任务 Bandit 与 MDP 中可证明的通用函数类表示学习

机器学习 2022-10-24 v3 人工智能

摘要

尽管多任务表示学习已成为强化学习 (RL) 中提升样本效率的流行方法,但关于其为何及如何生效的理论理解仍然有限。以往大多数分析工作只能假设表示函数已为智能体所知或来自线性函数类,因为分析通用函数类表示会遇到诸如泛化保证、抽象函数空间中置信界表述等非平凡技术障碍。然而,线性情形分析严重依赖线性函数类的特殊性,而现实实践通常采用如神经网络等通用非线性表示函数。这显著降低了其适用性。本工作中,我们将分析扩展至通用函数类表示。具体而言,我们考虑一个智能体并发地玩 MM 个上下文 bandit(或 MDP),并使用我们提出的广义函数上置信界算法 (GFUCB) 从特定函数类 Φ\Phi 中提取共享表示函数 ϕ\phi。我们首次从理论上证验了通用函数类下多任务表示学习在 bandit 与线性 MDP 中的益处。最后,我们开展实验以证明我们的算法在神经网络表示下的有效性。

关键词

引用

@article{arxiv.2205.15701,
  title  = {Provable General Function Class Representation Learning in Multitask Bandits and MDPs},
  author = {Rui Lu and Andrew Zhao and Simon S. Du and Gao Huang},
  journal= {arXiv preprint arXiv:2205.15701},
  year   = {2022}
}