中文

样本高效的强化学习在具有有限重访的线性可实现 MDP 中是可行的

机器学习 2021-10-19 v2 信息论 math.IT 最优化与控制 统计理论 机器学习 统计理论

摘要

线性函数表示等低复杂度模型在实现样本高效的强化学习(RL)中起着关键作用。本文涉及基于价值的线性表示场景,其假设最优 Q 函数具有线性可实现性(亦称“线性 QQ^{\star} 问题”)。虽然一般而言仅线性可实现性不足以保证样本高效的求解,但较大的次优性差距可能成为改变局面的关键因素,这取决于所采用的采样机制。非正式地说,当存在生成模型时,较大的次优性差距可实现样本高效,但在标准在线 RL 设定下却不可行。本文通过研究一种新的采样协议,在推动理解该线性 QQ^{\star} 问题方面取得进展:该协议以在线/探索式方式抽取样本,但允许以受控且不频繁的方式回溯并重访先前状态。该协议比标准在线 RL 设定更灵活,同时具有实际相关性,且远比生成模型受限。我们针对该设定开发了专用算法,其样本复杂度随特征维度、时间步长和次优性差距的倒数呈多项式缩放,而与状态/动作空间的大小无关。我们的发现强调了 RL 中采样协议与低复杂度结构表示之间的根本相互作用。

关键词

引用

@article{arxiv.2105.08024,
  title  = {Sample-Efficient Reinforcement Learning Is Feasible for Linearly Realizable MDPs with Limited Revisiting},
  author = {Gen Li and Yuxin Chen and Yuejie Chi and Yuantao Gu and Yuting Wei},
  journal= {arXiv preprint arXiv:2105.08024},
  year   = {2021}
}