中文

基于后验采样与延迟反馈的线性函数近似强化学习

机器学习 2023-11-07 v2 人工智能 机器学习

摘要

近期强化学习(RL)研究通过利用函数近似来缓解样本复杂性障碍以提升性能,取得了显著进展。尽管取得成功,现有可证明高效的算法通常依赖于动作后立即获得反馈。未能考虑观测延迟的影响,会因后悔值剧增而显著降级真实系统的性能。本文中,我们通过采用后验采样来解决带线性函数近似RL中的延迟反馈挑战,后验采样已在广泛范围内被证明在经验上优于流行的UCB算法。我们首先引入Delayed-PSVI,一种基于价值的乐观算法,通过带后验采样的噪声扰动有效探索价值函数空间。我们提供了首个带延迟反馈的后验采样RL算法分析,并表明我们的算法在未知随机延迟下达到 O~(d3H3T+d2H2E[τ])\widetilde{O}(\sqrt{d^3H^3 T} + d^2H^2 E[\tau]) 的最坏情况后悔值。此处 E[τ]E[\tau] 为期望延迟。为进一步提升计算效率并扩展其在高维RL问题中的适用性,我们为Delayed-LPSVI通过朗之万动力学引入了基于梯度的近似采样方案,其以 O~(dHK)\widetilde{O}(dHK) 计算代价保持同阶最优后悔保证。我们进行了经验评估以展示算法的统计与计算效能。

关键词

引用

@article{arxiv.2310.18919,
  title  = {Posterior Sampling with Delayed Feedback for Reinforcement Learning with Linear Function Approximation},
  author = {Nikki Lijing Kuang and Ming Yin and Mengdi Wang and Yu-Xiang Wang and Yi-An Ma},
  journal= {arXiv preprint arXiv:2310.18919},
  year   = {2023}
}