中文

Bellman 无偏性:面向通用价值函数近似的可证明高效分布式强化学习

机器学习 2025-05-14 v3 人工智能 机器学习

摘要

分布式强化学习通过捕获环境随机性来提升性能,但其有效性的全面理论理解仍然尚未明了。此外,无限维分布的不可解因素被忽视了。本文我们在有限回合马尔可夫决策过程中,对分布式强化学习与通用价值函数近似进行 regret 分析。我们首先引入关键概念的 Bellman 无偏性,这对于在线方式下精确可学习且高效的分布式更新至关重要。在所有用于表示无限维回报分布的统计函数类型中,我们的理论结果表明,只有 moment 函数才能精确捕获统计信息。其次,我们提出一种可证明高效的算法,\texttt{SF-LSVI},实现了 tight regret bound O~(dEH32K)\tilde{O}(d_E H^{\frac{3}{2}}\sqrt{K}),其中 HH 为时域,KK 为回合数,dEd_E 为函数类的 eluder 维度。

关键词

引用

@article{arxiv.2407.21260,
  title  = {Bellman Unbiasedness: Toward Provably Efficient Distributional Reinforcement Learning with General Value Function Approximation},
  author = {Taehyun Cho and Seungyub Han and Seokhun Ju and Dohyeong Kim and Kyungjae Lee and Jungwoo Lee},
  journal= {arXiv preprint arXiv:2407.21260},
  year   = {2025}
}