多领域音频问答基准测试:面向声学内容推理
声音
2026-03-10 v2 人工智能
计算与语言
多媒体
音频与语音处理
摘要
我们介绍了 DCASE 2025 挑战任务 5:一个跨越多种声学理解领域的音频问答 (AQA) 基准测试。该任务定义了三个 QA 子集(生物声学、时序声景和复杂问答),以测试音频语言模型在多样化声学场景上的交互式问答能力。我们描述了数据集构成(从海洋哺乳动物叫声到声景和复杂真实片段)、评估协议(top-1 准确率及答案随机性鲁棒性)以及基线系统(Qwen2-Audio-7B、AudioFlamingo 2、Gemini-2-Flash)。我们对开发集上的初步结果进行比较,显示不同模型和子集之间存在显著差异。该挑战旨在推进音频理解和推理能力,使其达到人类水平的敏锐度,这对于使 AI 代理能够有效感知和交互讨论世界至关重要。
引用
@article{arxiv.2505.07365,
title = {Multi-Domain Audio Question Answering Benchmark Toward Acoustic Content Reasoning},
author = {Chao-Han Huck Yang and Sreyan Ghosh and Qing Wang and Jaeyeon Kim and Hengyi Hong and Sonal Kumar and Guirui Zhong and Zhifeng Kong and S Sakshi and Vaibhavi Lokegaonkar and Oriol Nieto and Ramani Duraiswami and Dinesh Manocha and Gunhee Kim and Jun Du and Rafael Valle and Bryan Catanzaro},
journal= {arXiv preprint arXiv:2505.07365},
year = {2026}
}
备注
Dataset: https://huggingface.co/datasets/PeacefulData/2025_DCASE_AudioQA_Official DCASE Task-5 challenge: dcase.community/challenge2025/task-audio-question-answering. Accepted to ICASSP 2026