通过将动作与先前状态预测对齐来增强控制策略平滑度
机器学习
2026-01-27 v1
摘要
深度强化学习已被证明是解决控制任务的强大方法,但其特有的高频振荡使其难以应用于真实环境。虽然先前的方法通过基于架构或基于损失的方法解决了动作振荡问题,但后者通常依赖于状态相似性的启发式或合成定义来促进动作一致性,这往往无法准确反映潜在的系统动力学。在本文中,我们通过引入转移诱导相似状态,提出了一种新颖的基于损失的方法。转移诱导相似状态被定义为从先前状态转移而来的下一状态的分布。由于它仅利用环境反馈和实际收集的数据,因此能更好地捕获系统动力学。在此基础之上,我们引入了通过将动作与先前状态预测对齐来实现动作平滑(ASAP)的方法,这是一种有效缓解动作振荡的动作平滑方法。ASAP 通过将动作与在转移诱导相似状态下采取的动作对齐,并惩罚二阶差异以抑制高频振荡,从而强制实现动作平滑。在 Gymnasium 和 Isaac-Lab 环境中的实验表明,与现有方法相比,ASAP 能够产生更平滑的控制和更优的策略性能。
引用
@article{arxiv.2601.18479,
title = {Enhancing Control Policy Smoothness by Aligning Actions with Predictions from Preceding States},
author = {Kyoleen Kwak and Hyoseok Hwang},
journal= {arXiv preprint arXiv:2601.18479},
year = {2026}
}
备注
Accepted at AAAI-26. 7 pages (excluding references), 3 figures