无文本捷径的音频中心视频理解基准
计算机视觉与模式识别
2025-09-30 v3 人工智能
摘要
音频通常作为音频-视觉大型语言模型(LLM)视频理解任务的辅助模态,仅辅助理解视觉信息。然而,对视频的全面理解显著依赖于听觉信息,因为音频提供了关键的上下文、情感线索和语义含义,而视觉数据单独往往不足。本文提出一种音频中心视频理解基准(AVUT),以评估多模态 LLM 的视频理解能力,特别关注听觉信息。AVUT 引入一套精心设计的音频中心任务,全面测试音频内容和音频-视觉相互作用的理解。此外,本工作指出其他基准中存在文本捷径问题,即正确答案可从问题文本中直接找到,无需视频。AVUT 通过提出一种基于答案置换的过滤机制来解决此问题。对广泛的开源和专有多模态 LLM 进行了全面评估,随后分析了音频-视觉 LLM 的不足之处。演示和数据可在 https://github.com/lark-png/AVUT 中获得。
引用
@article{arxiv.2503.19951,
title = {Audio-centric Video Understanding Benchmark without Text Shortcut},
author = {Yudong Yang and Jimin Zhuang and Guangzhi Sun and Changli Tang and Yixuan Li and Peihan Li and Yifan Jiang and Wei Li and Zejun Ma and Chao Zhang},
journal= {arXiv preprint arXiv:2503.19951},
year = {2025}
}
备注
Accepted for publication in the Proceedings of EMNLP 2025 (Main Conference)