AURA Score:面向整体音频问答的评估指标
音频与语音处理
2025-10-07 v1 人工智能
摘要
音频问答 (AQA) 是评估音频语言模型 (ALM) 的关键任务,但评估开放式回答仍具有挑战性。现有用于 AQA 的评估指标,如 BLEU、METEOR 和 BERTScore,大多来自 NLP 和音频字幕领域,依赖表面相似性,未能考虑问题背景、推理过程及部分正确性。为填补文献中的空白,本文作出三项贡献:其一,引入 AQEval 以实现 AQA 指标的系统性基准测试。这一基准首次包含 1 万条模型回答,由多名人类标注者对其正确性和相关性进行标注。其二,对现有 AQA 指标在 AQEval 上的表现进行全面分析,揭示其与人类判断之间的关联度较弱,尤其在长回答方面更甚其然。其三,我们提出一种新型评估指标——AURA 分数,以更好地评估开放式模型回答。在 AQEval 上,AURA 分数实现了与人类评分的最高相关性,显著超越了所有基线方法。通过本工作,我们旨在凸显当前 AQA 评估方法的局限性,激励更优的评估指标。我们公开了 AQEval 基准数据集及 AURA 指标,以支持未来在整体 AQA 评估方面的研究。
引用
@article{arxiv.2510.04934,
title = {AURA Score: A Metric For Holistic Audio Question Answering Evaluation},
author = {Satvik Dixit and Soham Deshmukh and Bhiksha Raj},
journal= {arXiv preprint arXiv:2510.04934},
year = {2025}
}