EgoEverything:基于人类行为的长上下文原发性视频理解基准
机器学习
2026-04-10 v1
摘要
长上下文原发性视频理解最近受到广泛关注,增强现实 (AR) 被视为其最重要的应用领域之一。然而,该任务因需要在扩展的时间上下文中进行推理以及处理多样化且非结构化的活动而具有高度挑战性。虽然已有多个基准,但大多数原发性数据集依赖于佩戴在人身上的摄像机,主要关注视觉内容,对在构建视频相关查询时所涉及的用户行为仅有限地予以考虑。EgoEverything 是一个显式考虑人类行为的基准,利用从注视数据中抽象出来的注意力信号用于生成问题。该基准包含超过 5,000 条多选问答对,覆盖超过 100 小时的视频。通过在问题生成过程中整合人类注意力信号,EgoEverything 更忠实地捕捉自然人类行为,为 AR 环境下长上下文原发性视频理解提供了真实可信的评估环境。
引用
@article{arxiv.2604.08342,
title = {EgoEverything: A Benchmark for Human Behavior Inspired Long Context Egocentric Video Understanding in AR Environment},
author = {Qiance Tang and Ziqi Wang and Jieyu Lin and Ziyun Li and Barbara De Salvo and Sai Qian Zhang},
journal= {arXiv preprint arXiv:2604.08342},
year = {2026}
}