中文

面向从视频演示生成可行机器人运动的联合流轨迹优化

机器人学 2025-09-26 v1 人工智能 计算机视觉与模式识别

摘要

从人类视频演示中学习是一种可扩展的替代方案,相对于遥操作或亲手教学而言,但由于本体差异和关节可行性约束,对于机器人操作臂构成挑战。我们提出了面向抓取位姿生成和物体轨迹模仿的联合流轨迹优化(Joint Flow Trajectory Optimization, JFTO)框架,构建于基于视频的学习从演示(Learning-from-Demonstration, LfD)范式之下。不同于直接模仿人类手的动作,本方法将演示视为以物体为中心的指导,平衡三个目标:(i) 选择可行的抓取位姿,(ii) 生成与演示动作一致的物体轨迹,(iii) 确保在机器人运动学约束下实现碰撞自由。为捕捉演示的多模态性质,我们扩展流匹配(flow matching)至 \SE(3)\SE(3) 进行物体轨迹的概率建模,实现密度感知的模仿,避免模式坍缩。最终的优化将抓取相似性、轨迹似然性和碰撞惩罚整合为统一的可微分目标。我们在仿真和真实世界实验中验证了该方法在多样化实际操作任务中的有效性。

关键词

引用

@article{arxiv.2509.20703,
  title  = {Joint Flow Trajectory Optimization For Feasible Robot Motion Generation from Video Demonstrations},
  author = {Xiaoxiang Dong and Matthew Johnson-Roberson and Weiming Zhi},
  journal= {arXiv preprint arXiv:2509.20703},
  year   = {2025}
}