通过软 Mellowmax 算子稳定 Q 学习
机器学习
2020-12-21 v2
摘要
通过函数近似在高维状态空间中学习复杂值函数是一项艰巨任务,部分原因在于时序差分更新中使用的 max 算子在理论上会对大多数线性或非线性近似方案造成不稳定性。Mellowmax 是近年提出的具有可微性与非扩张性的 softmax 算子,可在学习与规划中带来收敛行为。遗憾的是,其收敛不动点的性能界仍不明确,且实践中其参数对各类领域敏感,须逐一调参。最后,Mellowmax 算子在聚合各动作时忽略其被选取概率,可能遭受过度平滑。本文以增强的 Mellowmax 算子 SM2(Soft Mellowmax)解决上述所有问题。特别地,所提算子可靠、易实现且具有可证明性能保证,同时保留 Mellowmax 全部优势。此外,我们展示 SM2 算子可应用于具挑战性的多智能体强化学习场景,实现稳定值函数近似与最先进性能。
引用
@article{arxiv.2012.09456,
title = {Stabilizing Q Learning Via Soft Mellowmax Operator},
author = {Yaozhong Gan and Zhe Zhang and Xiaoyang Tan},
journal= {arXiv preprint arXiv:2012.09456},
year = {2020}
}
备注
14 pages