中文

基于随机最小二乘值迭代的聚合状态并发学习

机器学习 2025-06-17 v3 人工智能

摘要

在复杂环境中设计高效探索的学习代理是强化学习中的一个基本挑战。虽然已有诸多工作表明基于随机价值函数的技术在单个代理上有效,但从理论角度看,将随机化注入代理群体(concurrently)进行环境探索是否有效尚不明确。本文所建立的理论结果已给出肯定答案。我们将并发学习框架适用于随机最小二乘值迭代(RLSVI),并采用聚合状态表示。我们在有限视野和无限视野环境中均证明了多项式 worst-case 后悔界。在两种设置下,单代理后悔值以 Θ(1N)\Theta\left(\frac{1}{\sqrt{N}}\right) 的最佳速率下降,突显并发学习的优势。我们的算法在空间复杂度上显著优于已有工作,仅需 K\sqrt{K} 的 worst-case 后悔惩罚,即可将空间复杂度降低 KK 倍。此外,我们进行数值实验以验证理论结论。

关键词

引用

@article{arxiv.2501.13394,
  title  = {Concurrent Learning with Aggregated States via Randomized Least Squares Value Iteration},
  author = {Yan Chen and Qinxun Bai and Yiteng Zhang and Shi Dong and Maria Dimakopoulou and Qi Sun and Zhengyuan Zhou},
  journal= {arXiv preprint arXiv:2501.13394},
  year   = {2025}
}