中文

音频大语言模型是听还是读?利用 VoxParadox 分析与缓解副语言失败

声音 2026-05-28 v1 机器学习

摘要

音频大语言模型(Audio LLM)在语音理解任务上表现出色,但其理解副语言信息的能力仍然有限。为系统量化这一问题,我们引入 VoxParadox,一个包含 2000 个经过验证的示例的对抗性基准,涵盖 10 项副语言任务,通过受控语音合成有意使转录文本声明与说话风格不匹配,从而直接衡量语音副语言理解能力。对多种 Audio LLM 的评估显示,它们在声学真实标签上的准确率持续偏低,并且强烈倾向于遵循语言暗示的(错误)答案。为理解这一差距的原因,我们进行逐层探测,发现:(i)副语言线索可能在更深的编码器层以及编码器-LLM 接口处退化;(ii)即使音频令牌中存在此类线索,语言模型也经常忽略它们。为解决这些问题,我们提出提示条件层混合器(PCLM),它根据输入提示自适应地组合来自多个音频层的信息,并将其与直接偏好优化(DPO)配对,以明确偏好声学支持的选项而非语言暗示的替代项。这些方法显著提升了 Audio LLM 的副语言理解能力,将 Audio Flamingo 3 在 VoxParadox 上的准确率从 17.40% 提升至 65.20%,在 MMSU 副语言子集上从 37.74% 提升至 54.78%。我们的项目页面可在 https://voxparadox.github.io/ 获取。

关键词

引用

@article{arxiv.2605.27772,
  title  = {Do Audio LLMs Listen or Read? Analyzing and Mitigating Paralinguistic Failures with VoxParadox},
  author = {Jiacheng Pang and Ashutosh Chaubey and Mohammad Soleymani},
  journal= {arXiv preprint arXiv:2605.27772},
  year   = {2026}
}

备注

Accepted as a conference paper at ICML 2026. Project page: https://voxparadox.github.io/