中文

N 体问题:从单人第三人称视角视频的平行执行

计算机视觉与模式识别 2025-12-15 v1

摘要

人类可以直观地对复杂活动进行平行化处理,但模型能否从仅观察一个人身上学到这一点?给定一段第三人称视角视频,我们提出 N 体问题:N 个个体如何在假设下执行同一组任务。目标是最大化加速比,但将视频片段粗暴分配给个体常常违反现实约束,导致出现两个人使用同一物体或占据同一空间等物理上不可能的情景。为此,我们形式化了 N 体问题,提出了一套评估指标,既衡量性能(加速比、任务覆盖率),也衡量可行性(空间碰撞、物体冲突和因果约束)。随后,我们引入结构化提示策略,引导视觉语言模型(VLM)推理 3D 环境、物体使用和时间依赖性,以产生可行的平行执行方案。在 100 段来自 EPIC-Kitchens 和 HD-EPIC 的视频中,我们的方法对于 N=2 的行动覆盖率比 Gemini 2.5 Pro 的基线提示提高了 45%,同时将碰撞率、物体冲突和因果冲突分别降低了 55%、45% 和 55%。

关键词

引用

@article{arxiv.2512.11393,
  title  = {The N-Body Problem: Parallel Execution from Single-Person Egocentric Video},
  author = {Zhifan Zhu and Yifei Huang and Yoichi Sato and Dima Damen},
  journal= {arXiv preprint arXiv:2512.11393},
  year   = {2025}
}

备注

project webpage: https://zhifanzhu.github.io/ego-nbody