中文

DiffOG:面向可迁移性的可微策略轨迹优化

机器人学 2025-11-11 v5

摘要

基于模仿学习的视觉-运动策略在操控任务中表现优异,但常常产生次优的动作轨迹,与基于模型的方法相比后者更好。直接通过神经网络将摄像头数据映射为动作,可能导致运动迅疃且难以满足关键约束,严重影响实际部署中的安全性和鲁棒性。对于需要高度鲁棒性或严格遵守约束的任务,确保轨迹质量至关重要。然而,神经网络的缺乏可解释性使得在受控 manner 下生成符合约束的动作变得具有挑战性。本文引入了可微策略轨迹优化与可迁移性(DiffOG),一种旨在提升视觉-运动策略的学习型轨迹优化框架。通过利用所提出的基于转换器的轨迹优化可微公式,DiffOG 无缝地将策略与通用化优化层集成。DiffOG 对动作轨迹进行细化,使其更加平滑且更符合约束要求,同时保持与原始演示分布的一致性,从而避免策略性能的下降。我们在 11 个仿真任务和 2 个实际任务中评估了 DiffOG。结果表明,DiffOG 在提升视觉-运动策略轨迹质量方面显著有效,同时对策略性能影响最小,超越了诸如贪心约束裁剪和基于惩罚的轨迹优化等轨迹处理基线方法。此外,DiffOG 的性能优于现有的受限视觉-运动策略。欲了解更多细节,请访问项目网站:https://zhengtongxu.github.io/diffog-website/。

关键词

引用

@article{arxiv.2504.13807,
  title  = {DiffOG: Differentiable Policy Trajectory Optimization with Generalizability},
  author = {Zhengtong Xu and Zichen Miao and Qiang Qiu and Zhe Zhang and Yu She},
  journal= {arXiv preprint arXiv:2504.13807},
  year   = {2025}
}