中文

面向以太空提示的视觉轨迹预测

计算机视觉与模式识别 2026-05-20 v1

摘要

机器人操作常通过语言指令或任务标识符指定,但在有相似物体的拥挤环境中,通过空间指示要移动什么以及要放置哪里更为有效。针对以视觉为中心的对象和目标指定挑战,我们提出了首个SP-VTP(以太空提示的视觉轨迹预测)问题的正式化。该新方法利用初始空间提示(如边界框或点)来定义任务目标,要求模型从第三人称视角流中预测未来的末端执行器轨迹。为研究此问题,我们收集并标注了EgoSPT数据集,包含第一帧的对象和目标 grounding 注释以及恢复的3D末端执行器运动。SP-VTP具有挑战性,因为任务指定是静态的,而场景配置随时间演化。为解决此问题,我们提出SPOT(Spatially Prompted Object-Target Policy),其结合了用于第一帧视觉和坐标空间提示的任务编码器、用于当前视觉和历史上下文的观察编码器,以及用于未来末端执行器运动的轨迹生成器。在严格的场景级别划分下进行的实验表明,SPOT在非提示驱动或单一来源提示基线的跨场景轨迹预测中取得改进。就EgoSPT和SPOT而言,建立了新的空间提示问题SP-VTP,作为以太空提示进行的机器人操作的简单且可扩展的任务条件。

关键词

引用

@article{arxiv.2605.20085,
  title  = {Spatially Prompted Visual Trajectory Prediction for Egocentric Manipulation},
  author = {Yifan Li and Xinyu Zhou and Yunhao Ge and Yu Kong},
  journal= {arXiv preprint arXiv:2605.20085},
  year   = {2026}
}