多模态大语言模型音频推理能力基准测试
声音
2026-01-28 v1 人工智能
摘要
当前用于测试多模态大语言模型音频模态的基准测试,集中于孤立地测试各种音频任务,例如说话人日志或性别识别。多模态模型能否回答需要推理能力以结合不同类别音频任务的问题,无法通过这些基准测试得到验证。为解决此问题,我们提出了音频推理任务 (ART),这是一个新的基准测试,用于评估多模态模型解决需要对音频信号进行推理的问题的能力。
引用
@article{arxiv.2601.19673,
title = {A Benchmark for Audio Reasoning Capabilities of Multimodal Large Language Models},
author = {Iwona Christop and Mateusz Czyżnikiewicz and Paweł Skórzewski and Łukasz Bondaruk and Jakub Kubiak and Marcin Lewandowski and Marek Kubis},
journal= {arXiv preprint arXiv:2601.19673},
year = {2026}
}
备注
31 pages, 2 figures, accepted to EACL 2026