万千不归于音频:重新思考文本先验与音频依赖性在音频-语言评估中的作用
声音
2026-04-28 v1 人工智能
计算与语言
音频与语音处理
摘要
大型音频-语言模型在语音和音频基准测试中表现出一致的性能提升,但高分数可能并不反映真正的听觉感知。如果模型能够在不处理声学信号的情况下回答问题,基准测试就无法作为听觉理解的度量。我们提出一种诊断框架,使用两个轴向:文本先验衡量仅凭文本和通用知识即可回答问题的可行性,音频依赖性衡量对声学信号的实际依赖程度。评估八个 LALM 在三个基准测试中的表现,我们发现即使没有任何音频输入,模型仍保留 60-72% 的完整音频得分。此外,对于需要音频的项目,仅有 3.0-4.2% 需要完整音频片段;大多数可以通过局部分片来解决。这些发现挑战了基准性能等于稳健音频理解的假设,我们随后给出改善评估可靠性和基准测试设计的实用指南。
引用
@article{arxiv.2604.24401,
title = {All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation},
author = {Leonardo Haw-Yang Foo and Chih-Kai Yang and Chen-An Li and Ke-Han Lu and Hung-yi Lee},
journal= {arXiv preprint arXiv:2604.24401},
year = {2026}
}
备注
6 pages, 3 figures, 5 tables