中文

通过软 Mellowmax 算子稳定 Q 学习

机器学习 2020-12-21 v2

摘要

通过函数近似在高维状态空间中学习复杂值函数是一项艰巨任务,部分原因在于时序差分更新中使用的 max 算子在理论上会对大多数线性或非线性近似方案造成不稳定性。Mellowmax 是近年提出的具有可微性与非扩张性的 softmax 算子,可在学习与规划中带来收敛行为。遗憾的是,其收敛不动点的性能界仍不明确,且实践中其参数对各类领域敏感,须逐一调参。最后,Mellowmax 算子在聚合各动作时忽略其被选取概率,可能遭受过度平滑。本文以增强的 Mellowmax 算子 SM2(Soft Mellowmax)解决上述所有问题。特别地,所提算子可靠、易实现且具有可证明性能保证,同时保留 Mellowmax 全部优势。此外,我们展示 SM2 算子可应用于具挑战性的多智能体强化学习场景,实现稳定值函数近似与最先进性能。

关键词

引用

@article{arxiv.2012.09456,
  title  = {Stabilizing Q Learning Via Soft Mellowmax Operator},
  author = {Yaozhong Gan and Zhe Zhang and Xiaoyang Tan},
  journal= {arXiv preprint arXiv:2012.09456},
  year   = {2020}
}

备注

14 pages