中文

深度反应式策略:学习用于动态环境的反应式机械臂运动规划

机器人学 2025-09-09 v1 人工智能 计算机视觉与模式识别 机器学习 系统与控制 系统与控制

摘要

在动态、部分可观测的环境中生成无碰撞运动是机械臂面临的一项根本挑战。经典运动规划器能计算全局最优轨迹,但需要完整的环境知识,且对于动态场景通常太慢。神经运动策略直接基于原始传感输入在闭环中运行,提供了一种有前景的替代方案,但往往难以在复杂或动态环境中泛化。我们提出深度反应式策略(DRP),一种视觉-运动神经运动策略,专为在多样动态环境中进行反应式运动生成而设计,直接基于点云传感输入运行。其核心是 IMPACT,一种基于 Transformer 的神经运动策略,在跨越多样仿真场景的 1000 万条生成专家轨迹上进行预训练。我们通过迭代师生微调进一步改进了 IMPACT 的静态避障能力。此外,我们在推理时使用 DCP-RMP(一种局部反应式目标提议模块)增强了策略的动态避障能力。我们在包含杂乱场景、动态移动障碍物和目标阻碍的挑战性任务上评估了 DRP。DRP 实现了强泛化能力,在仿真和真实环境中的成功率均优于先前的经典和神经方法。视频结果和代码可在 https://deep-reactive-policy.com 获取。

关键词

引用

@article{arxiv.2509.06953,
  title  = {Deep Reactive Policy: Learning Reactive Manipulator Motion Planning for Dynamic Environments},
  author = {Jiahui Yang and Jason Jingzhou Liu and Yulong Li and Youssef Khaky and Kenneth Shaw and Deepak Pathak},
  journal= {arXiv preprint arXiv:2509.06953},
  year   = {2025}
}

备注

Website at \url{deep-reactive-policy.com}