中文

愉悦梯度加速逃离角落

机器学习 2026-05-13 v1

摘要

Softmax 策略梯度以 O(1/t)O(1/t) 的速度收敛,但其在单纯形次优角落附近的瞬态行为可能呈指数级缓慢。瓶颈在于自陷:负优势动作会强化角落策略,并可能最初将最优动作向后推。我们研究了“愉悦策略梯度”(Delightful Policy Gradient, DG),该方法通过优势与动作惊异度的乘积来门控每个策略梯度项。对于 KK 臂赌博机,我们证明 DG 的零温度极限在任意次优角落附近的定量扇区内消除了这种角落陷落机制,从而产生一个与初始概率比成对数关系的首次逃逸时间界。在每个固定温度下,相同的局部机制仍然存在,因为有害动作随着其变得稀有而被多项式地抑制。一个关键的结构性洞见是,每个优于角落动作的动作都是一个“盟友”:它对逃逸的贡献是非负的。结合角落不稳定性与单调值改进恒等式,我们证明 DG 在赌博机和表格型 MDP 中均以渐近 O(1/t)O(1/t) 的速率全局收敛到最优策略。我们还通过一个精确的反例表明,这种表格型机制在共享函数近似下可能会失效。在使用共享参数神经网络的 MNIST 上下文赌博机中,DG 仍然比标准策略梯度更快地从不良初始化中恢复,这表明该反例标志着理论的边界,而非实际的禁令。

关键词

引用

@article{arxiv.2605.11908,
  title  = {Delightful Gradients Accelerate Corner Escape},
  author = {Jincheng Mei and Ian Osband},
  journal= {arXiv preprint arXiv:2605.11908},
  year   = {2026}
}

备注

Preprint