中文

EgoSound:面向无眼视角视频的声音理解基准测试

计算机视觉与模式识别 2026-04-21 v2

摘要

多模态大语言模型(MLLMs)近期在视觉语言理解方面取得了显著进展。然而,人类感知本质上是多感官的,综合了视觉、声音和运动信息来推理世界。在这些模态中,声音尤为关键,能够提供关于空间布局、非视野事件以及因果互动的必需线索,尤其在无眼视角场景中,声音与视觉信号紧密耦合。为此,我们引入EgoSound,第一个系统评估无眼视角视频中声音理解的基准测试。EgoSound统一了来自Ego4D和EgoBlind的数据,涵盖了盲人和依赖听觉的体验。它定义了七个任务范畴,涵盖内在声学感知、空间定位、因果推理和跨模态推理。通过多阶段自动生成流程构建的EgoSound包含900个视频的7315个验证后的问答对。对九个最先进的MLLMs进行全面实验后发现,当前模型展现出初步的听觉推理能力,但在细粒度的空间和因果理解方面仍受限。EgoSound为推动多感官无眼视角智能,弥合“看到世界”与“真正聆听世界”之间的鸿沟提供了具有挑战性的基础。项目页面:https://groolegend.github.io/EgoSound/。

关键词

引用

@article{arxiv.2602.14122,
  title  = {EgoSound: Benchmarking Sound Understanding in Egocentric Videos},
  author = {Bingwen Zhu and Yuqian Fu and Qiaole Dong and Guolei Sun and Tianwen Qian and Yuzheng Wu and Danda Pani Paudel and Xiangyang Xue and Yanwei Fu},
  journal= {arXiv preprint arXiv:2602.14122},
  year   = {2026}
}

备注

Accepted by CVPR 2026