从自我中心视觉中的动作描述生成6DoF物体操作轨迹
计算机视觉与模式识别
2025-06-05 v1
摘要
学习在常见场景中使用工具或物体,特别是按照指令以多种方式处理它们,是开发交互式机器人的关键挑战。训练模型生成此类操作轨迹需要大量且多样化的详细操作演示数据,涵盖各种物体,这在规模上几乎不可行。在本文中,我们提出了一种框架,利用大规模自我中心和外中心视频数据集——即全球投入大量精力构建的Exo-Ego4D数据集——来大规模提取多样化的操作轨迹。基于这些提取的轨迹及其相关的文本动作描述,我们开发了基于视觉和点云的语言模型驱动的轨迹生成模型。在最近提出的基于自我中心视觉的操作轨迹数据集HOT3D中,我们验证了模型能够成功生成有效的物体轨迹,为从自我中心视觉中的动作描述生成6DoF操作轨迹这一新任务建立了训练数据集和基线模型。
引用
@article{arxiv.2506.03605,
title = {Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision},
author = {Tomoya Yoshida and Shuhei Kurita and Taichi Nishimura and Shinsuke Mori},
journal= {arXiv preprint arXiv:2506.03605},
year = {2025}
}
备注
CVPR 2025