AV-Odyssey Bench:你的多模态大语言模型是否真正理解音视频信息?
计算机视觉与模式识别
2024-12-04 v1 人工智能
计算与语言
多媒体
声音
音频与语音处理
摘要
最近,像GPT-4o、Gemini 1.5 Pro和Reka Core等多模态大语言模型(MLLM)已扩展其能力,涵盖视觉和音频模态。尽管这些模型在广泛的音视频应用中表现出色,但我们提出的DeafTest揭示了MLLM在一些人类容易完成的简单任务中仍感到困难:1)判断两种声音中哪一种更大声,2)判断两种声音中哪一种的音调更高。针对这些观察,我们引入AV-Odyssey Bench—a全面的音视频基准测试,旨�在评估这些MLLM是否真正理解音视频信息。该基准包含4555个精心构建的问题,每个问题都包含文本、视觉和音频三个组成部分。要成功推断答案,模型必须有效地利用来自视觉和音频输入的线索。为确保对MLLM响应进行精确客观的评估,我们将问题结构化为多项选择题,无需人工评估或LLM辅助评估。我们对一系列闭源和开源模型进行基准测试并总结了观察结果。通过揭示当前模型的局限性,我们旨为未来的数据集收集和模型开发提供有用的见解。
引用
@article{arxiv.2412.02611,
title = {AV-Odyssey Bench: Can Your Multimodal LLMs Really Understand Audio-Visual Information?},
author = {Kaixiong Gong and Kaituo Feng and Bohao Li and Yibing Wang and Mofan Cheng and Shijia Yang and Jiaming Han and Benyou Wang and Yutong Bai and Zhuoran Yang and Xiangyu Yue},
journal= {arXiv preprint arXiv:2412.02611},
year = {2024}
}
备注
Project page: https://av-odyssey.github.io/