样本高效的强化学习在具有有限重访的线性可实现 MDP 中是可行的
机器学习
2021-10-19 v2 信息论
math.IT
最优化与控制
统计理论
机器学习
统计理论
摘要
线性函数表示等低复杂度模型在实现样本高效的强化学习(RL)中起着关键作用。本文涉及基于价值的线性表示场景,其假设最优 Q 函数具有线性可实现性(亦称“线性 问题”)。虽然一般而言仅线性可实现性不足以保证样本高效的求解,但较大的次优性差距可能成为改变局面的关键因素,这取决于所采用的采样机制。非正式地说,当存在生成模型时,较大的次优性差距可实现样本高效,但在标准在线 RL 设定下却不可行。本文通过研究一种新的采样协议,在推动理解该线性 问题方面取得进展:该协议以在线/探索式方式抽取样本,但允许以受控且不频繁的方式回溯并重访先前状态。该协议比标准在线 RL 设定更灵活,同时具有实际相关性,且远比生成模型受限。我们针对该设定开发了专用算法,其样本复杂度随特征维度、时间步长和次优性差距的倒数呈多项式缩放,而与状态/动作空间的大小无关。我们的发现强调了 RL 中采样协议与低复杂度结构表示之间的根本相互作用。
引用
@article{arxiv.2105.08024,
title = {Sample-Efficient Reinforcement Learning Is Feasible for Linearly Realizable MDPs with Limited Revisiting},
author = {Gen Li and Yuxin Chen and Yuejie Chi and Yuantao Gu and Yuting Wei},
journal= {arXiv preprint arXiv:2105.08024},
year = {2021}
}