环境访问在agnostic强化学习中的作用
摘要
我们研究了在大状态空间中的强化学习(RL),其中需要函数逼近以实现高效学习。我们 departing 于长期的先前工作,考虑最弱形式的函数逼近,称为agnostic policy learning,即学习者寻求在给定类别 中找到最佳政策,且无保证 包含 underlying task 的 optimal 政策。尽管已知在标准在线 RL 设置下,没有进一步假设的情况下,agnostic policy learning 无法实现高效学习,但我们调查了在更强环境访问下,这种情况能否被克服。具体而言,我们表明:1. 在获得局部模拟器访问(可从中重置到任何先前看到的状态)后,agnostic policy learning 仍然 statistically 不可行。这一结果即使在政策类别是 realizable 时也成立,与 [MFR24] 的正结果形成鲜明对比,后者表明在 realizability 情况下,value-based learning 在局部模拟器访问下是可行的。2. 在获得在状态空间上具有良好覆盖属性的重置分布的在线访问下(即所谓的 -reset 设置),agnostic policy learning 仍然 statistically 不可行。我们也研究了更强的函数逼近形式用于政策学习,表明 PSDP [BKSN03] 和 CPI [KL02] 在缺乏政策完整性时会失败。3. 在积极结果方面,对于 Block MDP,在上述两种重置模型中都可以使用的情况下,agnostic policy learning 是 statistically 可行的。我们通过一种 new algorithm 实现,这种算法仔细构建了一个政策模拟器:一个具有小状态空间的tabular MDP,用于逼近所有政策 的 value functions。这些 values 是在没有任何显式 value function class 的情况下进行逼近的。
引用
@article{arxiv.2504.05405,
title = {The Role of Environment Access in Agnostic Reinforcement Learning},
author = {Akshay Krishnamurthy and Gene Li and Ayush Sekhari},
journal= {arXiv preprint arXiv:2504.05405},
year = {2025}
}
备注
comments welcome