令人愉悦的策略梯度
机器学习
2026-03-17 v1 人工智能
最优化与控制
机器学习
摘要
标准策略梯度仅依据优势对每个抽样动作进行加权,无论该动作在当前策略下的可能性如何。这导致两种病态现象:在单个决策上下文(例如一张图片或提示)中,一个罕见的负优势动作会过度扭曲更新方向;在多个这样的上下文中,批处理中的预期梯度会在政策已经处理良好的上下文上过度分配预算。我们提出了"令人愉悦的策略梯度"(DG),该方法通过对每个术语施加一个sigmoid函数来控制该术语,其中"愉悦度"是优势与动作惊讶(负对数概率)之积。对于K臂老虎机,DG在单个上下文中可证明改进了方向准确性;在多个上下文中,DG将预期梯度严格地拉向监督交叉熵权威。这一第二效应并非方差缩减:即使有无限样本,仍然持有。实验上,我们在MNIST、transformer序列建模和连续控制任务中证明了DG优于REINFORCE、PPO和基于优势加权的基线,对于更难的任务,收益更大。
引用
@article{arxiv.2603.14608,
title = {Delightful Policy Gradient},
author = {Ian Osband},
journal= {arXiv preprint arXiv:2603.14608},
year = {2026}
}