中文

X-LeBench: extremely long egocentric video understanding基准

计算机视觉与模式识别 2026-01-27 v2

摘要

长时段第三人称视角视频理解提供丰富的上下文信息和独特的对长期人类行为的洞察,具有巨大的潜力,适用于具身智能、长期活动分析和个性化辅助技术等应用。然而,现有的基准数据集主要聚焦于单段短视频(例如,几分钟到几十分钟)或中等时长视频,仍存在评估大规模、超长时段第三人称视角视频录制的缺口。为此,我们引入X-LeBench,一个新颖的基准数据集,旨在填补这一空白,聚焦于需要全面理解极长时段第三人称视角视频录制的任务。我们的X-LeBench开发了一套模拟生活日志的管道,产生逼真且连贯的日常计划,与真实世界视频数据相吻合。这种方法使我们能够灵活地将合成日常计划与来自Ego4D——一个覆盖广泛日常生活情景的大规模第三人称视角视频数据集——的真实视频素材相结合,生成432段模拟视频生活日志,时长从23分钟延伸至16.4小时。对若干基线系统和多模态大语言模型(MLLMs)的评估显示,其表现普遍不佳,这凸显了长时段第三人称视角视频理解固有的挑战,如时序定位与推理、上下文聚合和记忆保持,进一步凸显了亟需更先进模型的必要性。

关键词

引用

@article{arxiv.2501.06835,
  title  = {X-LeBench: A Benchmark for Extremely Long Egocentric Video Understanding},
  author = {Wenqi Zhou and Kai Cao and Hao Zheng and Yunze Liu and Xinyi Zheng and Miao Liu and Per Ola Kristensson and Walterio Mayol-Cuevas and Fan Zhang and Weizhe Lin and Junxiao Shen},
  journal= {arXiv preprint arXiv:2501.06835},
  year   = {2026}
}