中文

EgoAVU:以太极音视频理解为目标

计算机视觉与模式识别 2026-02-09 v1

摘要

理解以太极视频对于具身智能至关重要。最近的多模态大语言模型(MLLM)可以接受视觉和音频输入。然而,由于获取具有一致联合模态信息的文本标签这一挑战,MLLM 是否能够在以太极视频中联合理解两种模态仍未得到充分探索。为解决这一问题,我们引入 EgoAVU,一个可自动生成以太极音视频叙述、问题和答案的可扩展数据引擎。EgoAVU 通过跨模态相关建模将人类叙述丰富化为多模态上下文,并通过跨模态相关建模生成音视频叙述。基于标记的视频过滤和模块化、图基的策辱确保数据多样性和质量。利用 EgoAVU,我们构建了 EgoAVU-Instruct,一个包含 300 万样本的大规模训练数据集,以及 EgoAVU-Bench,一个覆盖多样任务的手动验证评估子集。EgoAVU-Bench 清晰地揭示了现有 MLLM 的局限性:它们严重偏向视觉信号,常常忽略音频线索或无法将音频与视觉来源对应起来。在 EgoAVU-Instruct 上微调 MLLM 可有效解决此问题,使其在 EgoAVU-Bench 上的性能提升最高可达 113%。这些收益也可转移到其他基准测试,如 EgoTempo 和 EgoIllusion,实现最高可达 28% 的相对性能提升。将发布代码供社区使用。

关键词

引用

@article{arxiv.2602.06139,
  title  = {EgoAVU: Egocentric Audio-Visual Understanding},
  author = {Ashish Seth and Xinhao Mei and Changsheng Zhao and Varun Nagaraja and Ernie Chang and Gregory P. Meyer and Gael Le Lan and Yunyang Xiong and Vikas Chandra and Yangyang Shi and Dinesh Manocha and Zhipeng Cai},
  journal= {arXiv preprint arXiv:2602.06139},
  year   = {2026}
}