“不同的可微分模拟器是否给出更好的策略梯度?”中的策略梯度
机器学习
2026-04-21 v1 人工智能
机器人学
摘要
在策略梯度强化学习中,获取可微模型可实现1阶梯度估计,以加快学习速度,而无需依赖仅靠派生自由的0阶估计器。然而,离散动力学导致偏差,削弱了1阶估计器的有效性。先前工作通过构建REINFORCE 0阶梯度估计器周围的置信区间,并利用这些边界检测离散性来消除偏差。然而,REINFORCE估计器著名的噪声较大,我们发现该方法需要特定于任务的超参数调优且样本效率低。本文询问这种偏差是否是主要障碍,以及何种最小修复足以奏效。首先,我们重新审视先前工作中的标准离散设置,引入DDCG—a一种轻量级测试,在非光滑区域切换估计器;通过单个超参数,DDCG实现稳健性能,并在小样本下保持可靠。其次,在可微分机器人控制任务上,我们提出IVW-H—a一种每步逆变分实现,稳定方差而无需显式离散性检测,取得优异结果。总之,这些发现表明,虽然估计器切换在受控研究中提高鲁棒性,但在实际部署中,严谨的方差控制往往占主导。
引用
@article{arxiv.2604.18161,
title = {Does "Do Differentiable Simulators Give Better Policy Gradients?'' Give Better Policy Gradients?},
author = {Ku Onoda and Paavo Parmas and Manato Yaguchi and Yutaka Matsuo},
journal= {arXiv preprint arXiv:2604.18161},
year = {2026}
}
备注
ICLR2026