中文

TASTE-Rob:面向可泛化机器人操作的任务导向手物交互视频生成进展

计算机视觉与模式识别 2025-06-09 v2 机器人学

摘要

我们解决了现有任务导向手物交互视频生成数据集和模型的关键局限性,该方法是生成机器人模仿学习视频演示的关键途径。当前的数据集(如 Ego4D)通常存在视角不一致和交互不对齐的问题,导致视频质量下降,并限制了其在精确模仿学习任务中的适用性。为此,我们引入了 TASTE-Rob——一个包含 100,856 个以自我为中心的手物交互视频的开创性大规模数据集。每个视频都经过精心处理,与语言指令对齐,并从一致的摄像机视角记录,以确保交互的清晰度。通过在 TASTE-Rob 上微调 Video Diffusion Model (VDM),我们实现了逼真的物体交互,尽管我们观察到手部抓取姿态偶尔存在不一致。为了增强真实性,我们引入了一个三阶段的姿态优化流水线,以提高生成视频中手部姿态的准确性。我们精选的数据集结合专门的姿态优化框架,在生成高质量、任务导向的手物交互视频方面取得了显著的性能提升,从而实现了更优越的可泛化机器人操作。TASTE-Rob 数据集已公开以促进该领域的进一步发展,TASTE-Rob 数据集和源代码将在我们的网站 https://taste-rob.github.io 上公开。

关键词

引用

@article{arxiv.2503.11423,
  title  = {TASTE-Rob: Advancing Video Generation of Task-Oriented Hand-Object Interaction for Generalizable Robotic Manipulation},
  author = {Hongxiang Zhao and Xingchen Liu and Mutian Xu and Yiming Hao and Weikai Chen and Xiaoguang Han},
  journal= {arXiv preprint arXiv:2503.11423},
  year   = {2025}
}

备注

CVPR 2025; Project Page: https://taste-rob.github.io