通过动作Jacobian惩罚学习平滑时变线性策略
机器人学
2026-02-23 v1 图形学
摘要
强化学习提供了一种学习控制策略的框架,可再现各种模拟人物的动作。然而,这些策略常常利用不可被人类或物理机器人实现的高频信号,导致其不符合实际世界行为。现有方法通过添加惩罚动作随时间变化大的奖励项来解决此问题。该项通常需要大量调参。我们提出使用动作Jacobian惩罚,该惩罚直接通过自动微分对状态变化施加动作变化惩罚,从而消除不切实际的高频控制信号,无需任务特定调参。虽然有效,但动作Jacobian惩罚在与传统全连接神经网络架构搭配使用时引入显著计算开销。为缓解此问题,我们引入一种名为线性策略网络(LPN)的新型架构,显著降低在训练期间计算动作Jacobian惩罚的计算负担。此外,LPN无需参数调参,相较于基线方法表现出更快的学习收敛速度,在推断时也比全连接神经网络更高效。我们展示,结合动作Jacobian惩罚的线性策略网络,能够学习生成平滑信号的策略,解决多种不同特征的动作模仿任务,包括后翻等动态动作以及各种具有挑战性的攀岩技能。最后,我们将此方法应用于为配备机臂的动态四足机器人创建策略。
关键词
引用
@article{arxiv.2602.18312,
title = {Learning Smooth Time-Varying Linear Policies with an Action Jacobian Penalty},
author = {Zhaoming Xie and Kevin Karol and Jessica Hodgins},
journal= {arXiv preprint arXiv:2602.18312},
year = {2026}
}