中文

CMDAR:中文多场景动态音频推理基准——涵盖多样挑战

声音 2026-01-07 v3 人工智能 计算与语言 音频与语音处理

摘要

从音频中进行推理——包括语音、环境声和音乐——是 AI 智能体在真实场景中有效交互的关键能力。现有基准主要聚焦于静态或单场景设置及英文音频数据,未能充分捕捉多说话者、事件动态展开以及异构音频源相互作用的场景。为此,我们引入 CMDAR,一个用于评估复杂、多场景和动态演化音频推理任务的中文基准。CMDAR 包含 3000 组精心策划的问答对,涵盖多样化音频剪辑,涉及五类复杂推理任务,分为三种问答类型。我们在 CMDAR 上对 26 个前沿音频语言模型进行基准测试,发现其在复杂推理任务中存在局限。CMDAR-main 中,Qwen2.5-Omni 实现了 76.67% 的准确率,而 GPT-4o Audio 达到 68.47%。然而,在更具挑战性的多音频多选题和开放式任务中,GPT-4o Audio 在准确率上显著超越 Qwen2.5-Omni。我们提供详细分析并给出对大型音频语言模型未来发展的建议。

关键词

引用

@article{arxiv.2509.22461,
  title  = {CMDAR: A Chinese Multi-scene Dynamic Audio Reasoning Benchmark with Diverse Challenges},
  author = {Hui Li and Changhao Jiang and Hongyu Wang and Ming Zhang and Jiajun Sun and Zhixiong Yang and Yifei Cao and Shihan Dou and Xiaoran Fan and Baoyu Fan and Tao Ji and Tao Gui and Qi Zhang and Xuanjing Huang},
  journal= {arXiv preprint arXiv:2509.22461},
  year   = {2026}
}

备注

25 pages, 7 figures