Interspeech 2026音频推理挑战赛:评估音频推理模型与智能体的推理过程质量
声音
2026-02-17 v1 计算与语言
多媒体
摘要
近期的大型音频语言模型(LALMs)在理解方面表现出色,但往往缺乏透明的推理过程。为了解决这一“黑箱”局限性,我们在Interspeech 2026上组织了音频推理挑战赛,这是首个致力于评估音频领域思维链(CoT)质量的共享任务。该挑战赛引入了MMAR-Rubrics,这是一种新颖的实例级协议,用于评估推理链的事实性和逻辑性。比赛设有单模型和智能体两个赛道,吸引了来自18个国家和地区的156支队伍。结果显示,智能体系统目前在推理质量上处于领先地位,它们利用迭代工具编排和跨模态分析。此外,单模型通过强化学习和复杂的数据流水线正在迅速进步。我们详细阐述了挑战赛的设计、方法论,并对最先进的系统进行了全面分析,为可解释音频智能提供了新的见解。
引用
@article{arxiv.2602.14224,
title = {The Interspeech 2026 Audio Reasoning Challenge: Evaluating Reasoning Process Quality for Audio Reasoning Models and Agents},
author = {Ziyang Ma and Ruiyang Xu and Yinghao Ma and Chao-Han Huck Yang and Bohan Li and Jaeyeon Kim and Jin Xu and Jinyu Li and Carlos Busso and Kai Yu and Eng Siong Chng and Xie Chen},
journal= {arXiv preprint arXiv:2602.14224},
year = {2026}
}
备注
The official website of the Audio Reasoning Challenge: https://audio-reasoning-challenge.github.io