中文

音乐问答基准中的感知意识提升:针对 RUListening 框架的检验

声音 2025-06-11 v2

摘要

大型音频语言模型(LALM)通过对预训练文本大语言模型进行音频输入的微调,在音乐理解方面取得了显著进展。然而,当前的评估方法存在关键局限性:在领先的音乐问答基准 MuchoMusic 上,无音频感知能力的文本-only 大语言模型实现了最高可达 56.4% 的准确率,与大多数 LALM 相当或更高。此外,当面对随机高斯噪声而非实际音频时,LALM 仍显著高于随机猜测。这些发现表明,现有基准主要评估推理能力而非音频感知。为克服这一挑战,我们提出 RUListening:通过倾听实现稳健理解,一个增强音乐问答基准感知评估的框架。我们引入感知指数(PI),通过分析文本-only 语言模型的对数概率分布来衡量问题对音频感知依赖程度。使用该指数,我们生成合成的具挑战性干扰项,以创建需要真实音频感知的问答对。应用于 MuchoMusic 后,我们的筛选数据集成功迫使模型依赖感知信息——文本-only 大语言模型在此基础上达到随机水平,而 LALM 在音频输入被替换为噪声时同样恶化。这些结果验证了我们框架在创建更准确评估音频感知能力的基准方面的有效性。

关键词

引用

@article{arxiv.2504.00369,
  title  = {Are you really listening? Boosting Perceptual Awareness in Music-QA Benchmarks},
  author = {Yongyi Zang and Sean O'Brien and Taylor Berg-Kirkpatrick and Julian McAuley and Zachary Novack},
  journal= {arXiv preprint arXiv:2504.00369},
  year   = {2025}
}

备注

ISMIR 2025