中文

利用最大均值差异重心传播强化学习中值函数的不确定性

机器学习 2024-04-04 v2

摘要

考虑值函数的不确定性能够促进强化学习 (Reinforcement Learning, RL) 中的探索。我们的工作引入了最大均值差异 Q 学习 (Maximum Mean Discrepancy Q-Learning, MMD-QL),以改进 Wasserstein Q 学习 (Wasserstein Q-Learning, WQL) 在时序差分 (Temporal Difference, TD) 更新期间的不确定性传播。MMD-QL 为此使用 MMD 重心,因为与 Wasserstein 距离相比,MMD 提供了概率测度之间更紧密的接近度估计。首先,我们证明在平均损失度量下,MMD-QL 在 MDP 中是可能近似正确的 (Probably Approximately Correct in MDP, PAC-MDP)。关于累积奖励,在表格环境上的实验表明 MMD-QL 优于 WQL 和其他算法。其次,我们将深度网络纳入 MMD-QL 以创建 MMD Q 网络 (MMD Q-Network, MMD-QN)。在合理假设下,我们分析了使用函数逼近时 MMD-QN 的收敛率。在具有挑战性的 Atari 游戏上的实证结果表明,与基准深度 RL 算法相比,MMD-QN 表现良好,突出了其在处理大型状态-动作空间方面的有效性。

关键词

引用

@article{arxiv.2404.00686,
  title  = {Utilizing Maximum Mean Discrepancy Barycenter for Propagating the Uncertainty of Value Functions in Reinforcement Learning},
  author = {Srinjoy Roy and Swagatam Das},
  journal= {arXiv preprint arXiv:2404.00686},
  year   = {2024}
}

备注

We found some flaws in our analysis and we are in the process of rectifying those