中文

面向Actor-Critic策略平滑性的Q-梯度场稳定化

机器学习 2026-02-02 v1 人工智能

摘要

通过连续Actor-Critic方法学习的策略常表现出erratic的、高频振荡的特征,难以用于实际部署。现有方法通过直接对策略输出进行正则化来实现平滑性,试图治标。我们认为,这种做法治标不治本。本文通过对Actor-Critic目标进行隐式微分,理论上确立了策略非平滑性根本由评价函数的微分几何所决定。我们证明,最优策略的灵敏度受Q函数的混合偏导数(噪声灵敏度)与其动作空间曲率(信号区分度)之比所界定。为 empirically 验证这一理论洞察,我们引入PAVE(Policy-Aware Value-field Equalization),一种以评价函数为标量场的 critic 聚焦正则化框架。PAVE通过最小化Q梯度波动性同时保持局部曲率,来纠正学习信号。实验结果表明,PAVE在实现与策略侧平滑正则化方法相当的平滑性和鲁棒性方面,同时保持竞争的任务性能,且无需修改演员。

关键词

引用

@article{arxiv.2601.22970,
  title  = {Stabilizing the Q-Gradient Field for Policy Smoothness in Actor-Critic},
  author = {Jeong Woon Lee and Kyoleen Kwak and Daeho Kim and Hyoseok Hwang},
  journal= {arXiv preprint arXiv:2601.22970},
  year   = {2026}
}