中文

人类-机器人交互:从视频演示学习的机器人仿照

机器人学 2026-02-24 v1

摘要

从演示学习(LfD)提供了机器人技能获取的有前景的范式。最近的尝试从视频演示中直接提取操作命令的 метод 仍面临两个关键挑战:(1)通用视频描述模型优先关注全局场景特征而非任务相关对象,产生不适用于精确机器人执行的描述;(2)将视觉理解与策略学习耦合的端到端架构需要大量配对数据集,并且难以在不同对象和情境之间泛化。为克服这些限制,我们提出了一种新颖的“人类到机器人”仿照学习管道,使机器人能够从非结构化视频演示中直接获取操作技能,受人类通过观看和模仿学习的启发。我们的关键创新是一种模块化框架,将学习过程分解为两个 distinct 阶段:(1)视频理解,结合时间位移模块(TSM)和视觉语言模型(VLM)以提取操作并识别交互对象;(2)机器人仿照,采用TD3-based深度强化学习以执行演示的操作。我们在PyBullet仿真环境中使用UR5e操作臂,并在真实世界实验中使用UF850操作臂进行验证,涵盖到达、抓取、移动和放置四项基本操作。对于视频理解,我们的方法在标准对象上实现了89.97%的操作分类准确率,BLEU-4分为0.351,在新对象上为0.265,分别比最佳基线提高了76.4%和128.4%。对于机器人操作,我们的框架在所有操作中实现了87.5%的平均成功率,到达任务达到100%成功率,对复杂的抓取和放置操作达到最高90%成功率。项目网站可在https://thanhnguyencanh.github.io/LfD4hri 查看。

关键词

引用

@article{arxiv.2602.19184,
  title  = {Human-to-Robot Interaction: Learning from Video Demonstration for Robot Imitation},
  author = {Thanh Nguyen Canh and Thanh-Tuan Tran and Haolan Zhang and Ziyan Gao and Nak Young Chong and Xiem HoangVan},
  journal= {arXiv preprint arXiv:2602.19184},
  year   = {2026}
}