中文

线性MDP中多任务表示学习的威力

机器学习 2021-06-16 v1 人工智能

摘要

尽管多任务表示学习已成为强化学习(RL)中的一种流行方法,但关于其为何及何时有效的理论理解仍然有限。本文在生成模型下,对线性马尔可夫决策过程(MDP)中多任务表示学习的统计益处进行了分析。在本文中,我们考虑一个智能体从 TT 个源任务(每任务 NN 个数据)的函数类 Φ\Phi 中学习表示函数 ϕ\phi,然后使用学习到的 ϕ^\hat{\phi} 来减少新任务所需的样本数。我们首先发现了一个称为 \emph{Least-Activated-Feature-Abundance}(LAFA,最小激活特征丰度)的准则,记为 κ\kappa,并据此证明一个直接的最小二乘算法学到的策略的次优性为 O~(H2C(Φ)2κdNT+κdn)\tilde{O}(H^2\sqrt{\frac{\mathcal{C}(\Phi)^2 \kappa d}{NT}+\frac{\kappa d}{n}})。这里 HH 是规划时域,C(Φ)\mathcal{C}(\Phi)Φ\Phi 的复杂度度量,dd 是表示的维度(通常 dC(Φ)d\ll \mathcal{C}(\Phi)),nn 是新任务的样本数。因此,为使次优性接近于零,所需的 nnO(κdH4)O(\kappa d H^4),远小于无多任务表示学习设定下的 O(C(Φ)2κdH4)O(\mathcal{C}(\Phi)^2\kappa d H^4),后者的次优性差距为 O~(H2κC(Φ)2dn)\tilde{O}(H^2\sqrt{\frac{\kappa \mathcal{C}(\Phi)^2d}{n}})。这在理论上解释了多任务表示学习在降低样本复杂度方面的威力。进一步,我们注意到为确保高样本效率,LAFA 准则 κ\kappa 应当较小。事实上,κ\kappa 的大小随新任务的不同采样分布而大幅变化。这表明自适应采样技术对于使 κ\kappa 仅依赖于 dd 十分重要。最后,我们给出了一个含噪网格世界环境的实证结果以佐证我们的理论发现。

关键词

引用

@article{arxiv.2106.08053,
  title  = {On the Power of Multitask Representation Learning in Linear MDP},
  author = {Rui Lu and Gao Huang and Simon S. Du},
  journal= {arXiv preprint arXiv:2106.08053},
  year   = {2021}
}