中文

动如何决定将何为:基于轨迹的以第一人称视角预测

计算机视觉与模式识别 2026-05-21 v1

摘要

预测一个人的第一人称视角将如何演变(下一个动作是什么、什么计划能完成任务、进行中的镜头是否得分)是根本不明确的:相同的情境容纳多种合理的未来,训练最小化预测误差的模型被迫对它们进行保守或平均,结果无论如何都错。我们的两种发现塑造了方法。首先,未来摄像机轨迹——头部在空间中划过的路径,使模型能够在这些未来中作出选择:它携带着操作者的意图,以足够细致的形式确定动作如何展开,显著优于语言作为条件信号。其次,这种意图同样使得轨迹本身部分可预测来自上下文,足以在测试时无需观察轨迹即可恢复大部分收益。我们将这些发现具体化为 TrajPilot 模型,该模型从以第一人称视角上下文中预测候选未来轨迹,并使用它们在动作对齐的嵌入空间中驾驭动作预测,该空间中语言塑造结构但从不作为条件输入。TrajPilot 在Ego-Exo4D 原子任务、Ego-Exo4D Keystep、Ego4D GoalStep 和 EgoPER 上击败 VLM 和结构规划基准,轨迹优势随着时间范围的扩大而扩大(恰好在先前规划方法崩溃的地方),并且在仅使用 RGB 的相机-姿态估计情况下仍然保持。当目标被遮蔽且进行推理时,同一模型执行无目标预测,在 Ego-Exo4D 原子任务上击败 VLM 基准,并扩展到 EPIC-Kitchens-100 和篮球射门结果预测上。

关键词

引用

@article{arxiv.2605.20388,
  title  = {How You Move Tells What You'll Do: Trajectory-Conditioned Egocentric Prediction},
  author = {Sejoon Jun and Hai Nguyen-Truong and Luigi Seminara and Lorenzo Torresani},
  journal= {arXiv preprint arXiv:2605.20388},
  year   = {2026}
}

备注

Project page: https://farsightlab.github.io/TrajPilot