中文

AudioCapBench:快速评估跨声、音乐、语音的音频描述能力

声音 2026-03-02 v1 人工智能

摘要

我们引入AudioCapBench,这是一个用于评估大型多模态模型音频描述能力的基准测试。\method 覆盖三个不同的音频领域,包括环境声、音乐和语音,包含 1000 个精选的评估样本。我们评估了13个模型(来自OpenAI和Google Gemini),使用参考基准指标(METEOR、BLEU、ROUGE-L)以及LLM-as-Judge框架,对预测结果在三个正交维度上进行评分:\textit{准确性}(语义正确性)、\textit{完整性}(覆盖参考内容的程度)和\textit{幻觉}(缺乏虚构内容)。我们的结果显示,Gemini模型总体上在整体描述质量方面优于OpenAI模型,其中Gemini~3~Pro获得了最高的整体得分(6.00/10),而OpenAI模型表现出较低的幻觉率。所有模型在语音描述方面表现最好,在音乐描述方面表现最差。我们发布了该基准以及评估代码,以促进可重复的音频理解研究。

关键词

引用

@article{arxiv.2602.23649,
  title  = {AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech},
  author = {Jielin Qiu and Jianguo Zhang and Zixiang Chen and Liangwei Yang and Ming Zhu and Juntao Tan and Haolin Chen and Wenting Zhao and Rithesh Murthy and Roshan Ram and Akshara Prabhakar and Shelby Heinecke and Caiming and Xiong and Silvio Savarese and Huan Wang},
  journal= {arXiv preprint arXiv:2602.23649},
  year   = {2026}
}