中文

EgoExo-Con:探索视频时间理解中的视角无关性

计算机视觉与模式识别 2025-10-31 v1 人工智能

摘要

视频-LLM 在捕获相同事件但来自不同视角的视频时,能否实现一致的时间理解?为此,我们提出 EgoExo-Con(一致性),这是一个包含全方位同步式镜像中心视角和外观视角视频对的基准测试,包含经过人类细化的自然语言查询。EgoExo-Con 强调两个时间理解任务:时间验证与时间定位。它不仅评估正确性,还评估跨视角的一致性。我们的分析揭示了现有视频-LLM 的两个关键局限性:(1)模型往往无法保持一致性,其结果远差于单视图性能。(2)在同步两端视角视频进行微调后,模型显示出改进的一致性,但往往表现不如仅用单视图训练的模型。为改进,我们提出 View-GRPO,这是一个新型强化学习框架,有效加强视角特定的时间推理,同时鼓励跨视角的一致理解。我们的方法在超越朴素 SFT 和 GRPO 的情况下尤其擅长提高跨视图一致性。所有资源将公开提供。

关键词

引用

@article{arxiv.2510.26113,
  title  = {EgoExo-Con: Exploring View-Invariant Video Temporal Understanding},
  author = {Minjoon Jung and Junbin Xiao and Junghyun Kim and Byoung-Tak Zhang and Angela Yao},
  journal= {arXiv preprint arXiv:2510.26113},
  year   = {2025}
}

备注

project page: \url{https://minjoong507.github.io/projects/EgoExo-Con/}