中文

多模态大语言模型音频推理能力基准测试

声音 2026-01-28 v1 人工智能

摘要

当前用于测试多模态大语言模型音频模态的基准测试,集中于孤立地测试各种音频任务,例如说话人日志或性别识别。多模态模型能否回答需要推理能力以结合不同类别音频任务的问题,无法通过这些基准测试得到验证。为解决此问题,我们提出了音频推理任务 (ART),这是一个新的基准测试,用于评估多模态模型解决需要对音频信号进行推理的问题的能力。

关键词

引用

@article{arxiv.2601.19673,
  title  = {A Benchmark for Audio Reasoning Capabilities of Multimodal Large Language Models},
  author = {Iwona Christop and Mateusz Czyżnikiewicz and Paweł Skórzewski and Łukasz Bondaruk and Jakub Kubiak and Marcin Lewandowski and Marek Kubis},
  journal= {arXiv preprint arXiv:2601.19673},
  year   = {2026}
}

备注

31 pages, 2 figures, accepted to EACL 2026