音频大语言模型是听还是读?利用 VoxParadox 分析与缓解副语言失败
声音
2026-05-28 v1 机器学习
摘要
音频大语言模型(Audio LLM)在语音理解任务上表现出色,但其理解副语言信息的能力仍然有限。为系统量化这一问题,我们引入 VoxParadox,一个包含 2000 个经过验证的示例的对抗性基准,涵盖 10 项副语言任务,通过受控语音合成有意使转录文本声明与说话风格不匹配,从而直接衡量语音副语言理解能力。对多种 Audio LLM 的评估显示,它们在声学真实标签上的准确率持续偏低,并且强烈倾向于遵循语言暗示的(错误)答案。为理解这一差距的原因,我们进行逐层探测,发现:(i)副语言线索可能在更深的编码器层以及编码器-LLM 接口处退化;(ii)即使音频令牌中存在此类线索,语言模型也经常忽略它们。为解决这些问题,我们提出提示条件层混合器(PCLM),它根据输入提示自适应地组合来自多个音频层的信息,并将其与直接偏好优化(DPO)配对,以明确偏好声学支持的选项而非语言暗示的替代项。这些方法显著提升了 Audio LLM 的副语言理解能力,将 Audio Flamingo 3 在 VoxParadox 上的准确率从 17.40% 提升至 65.20%,在 MMSU 副语言子集上从 37.74% 提升至 54.78%。我们的项目页面可在 https://voxparadox.github.io/ 获取。
引用
@article{arxiv.2605.27772,
title = {Do Audio LLMs Listen or Read? Analyzing and Mitigating Paralinguistic Failures with VoxParadox},
author = {Jiacheng Pang and Ashutosh Chaubey and Mohammad Soleymani},
journal= {arXiv preprint arXiv:2605.27772},
year = {2026}
}
备注
Accepted as a conference paper at ICML 2026. Project page: https://voxparadox.github.io/