基于封顶隐式探索在 softmax 策略梯度与神经复制动力学之间的插值
机器学习
2022-06-07 v1 人工智能
机器学习
摘要
神经复制动力学(NeuRD)是受在线学习与演化博弈论启发的、基础性的 softmax 策略梯度(SPG)算法的替代方案。NeuRD 的期望更新被设计为与 SPG 几乎相同,然而我们表明蒙特卡洛更新在实质方式上有所不同:对采样动作的重要性修正于 SPG 更新中被抵消,而在 NeuRD 更新中则没有。自然地,这导致 NeuRD 更新比其 SPG 对应项具有更高的方差。基于对抗式赌博机设置中的隐式探索算法,我们引入封顶隐式探索(CIX)估计,使我们能够构建 NeuRD-CIX,其在 NeuRD 与 SPG 的这一方面之间进行插值。我们展示了 CIX 估计如何用于黑盒归约以构建具有高概率成立 regret 界的赌博机算法,以及这为序贯决策设置中的 NeuRD-CIX 带来的好处。我们的分析揭示了 SPG 与 NeuRD 之间的偏差-方差权衡,并表明理论预测 NeuRD-CIX 将比 NeuRD 更一致地表现良好,同时在非平稳环境中保留 NeuRD 相对于 SPG 的优势。
引用
@article{arxiv.2206.02036,
title = {Interpolating Between Softmax Policy Gradient and Neural Replicator Dynamics with Capped Implicit Exploration},
author = {Dustin Morrill and Esra'a Saleh and Michael Bowling and Amy Greenwald},
journal= {arXiv preprint arXiv:2206.02036},
year = {2022}
}
备注
At Reinforcement Learning and Decision Making 2022, June 2022. 9 pages and 1 figure