DiffTORI:用于深度强化学习和模仿学习的可微分轨迹优化
机器学习
2025-06-16 v5 人工智能
机器人学
摘要
本文介绍了 DiffTORI,该方法利用可微分轨迹优化作为策略表示,为深度强化学习和模仿学习生成动作。轨迹优化是控制领域中一种强大且广泛使用的算法,由代价函数和动力学函数参数化。我们方法的关键在于利用可微分轨迹优化的最新进展,这使得能够计算损失相对于轨迹优化参数的梯度。因此,轨迹优化的代价函数和动力学函数可以端到端地学习。DiffTORI 解决了先前基于模型的强化学习算法中的“目标不匹配”问题,因为 DiffTORI 中的动力学模型是通过轨迹优化过程微分策略梯度损失来直接最大化任务性能而学习的。我们进一步在具有高维感官观测的标准机器人操作任务套件上对 DiffTORI 进行模仿学习基准测试,并将其与前馈策略类以及基于能量的模型 (EBM) 和扩散模型进行比较。在 15 个基于模型的强化学习任务和 35 个具有高维图像和点云输入的模仿学习任务中,DiffTORI 在这两个领域均优于先前的最先进方法。我们的代码可在 https://github.com/wkwan7/DiffTORI 获取。
引用
@article{arxiv.2402.05421,
title = {DiffTORI: Differentiable Trajectory Optimization for Deep Reinforcement and Imitation Learning},
author = {Weikang Wan and Ziyu Wang and Yufei Wang and Zackory Erickson and David Held},
journal= {arXiv preprint arXiv:2402.05421},
year = {2025}
}
备注
NeurIPS 2024 (Spotlight)