基于后验采样与延迟反馈的线性函数近似强化学习
机器学习
2023-11-07 v2 人工智能
机器学习
摘要
近期强化学习(RL)研究通过利用函数近似来缓解样本复杂性障碍以提升性能,取得了显著进展。尽管取得成功,现有可证明高效的算法通常依赖于动作后立即获得反馈。未能考虑观测延迟的影响,会因后悔值剧增而显著降级真实系统的性能。本文中,我们通过采用后验采样来解决带线性函数近似RL中的延迟反馈挑战,后验采样已在广泛范围内被证明在经验上优于流行的UCB算法。我们首先引入Delayed-PSVI,一种基于价值的乐观算法,通过带后验采样的噪声扰动有效探索价值函数空间。我们提供了首个带延迟反馈的后验采样RL算法分析,并表明我们的算法在未知随机延迟下达到 的最坏情况后悔值。此处 为期望延迟。为进一步提升计算效率并扩展其在高维RL问题中的适用性,我们为Delayed-LPSVI通过朗之万动力学引入了基于梯度的近似采样方案,其以 计算代价保持同阶最优后悔保证。我们进行了经验评估以展示算法的统计与计算效能。
引用
@article{arxiv.2310.18919,
title = {Posterior Sampling with Delayed Feedback for Reinforcement Learning with Linear Function Approximation},
author = {Nikki Lijing Kuang and Ming Yin and Mengdi Wang and Yu-Xiang Wang and Yi-An Ma},
journal= {arXiv preprint arXiv:2310.18919},
year = {2023}
}