自适应向量引导:用于大型音频与多模态模型中幻觉缓解的训练-free,分层干预方法
声音
2025-10-16 v1 机器学习
音频与语音处理
摘要
大型音频-语言模型和多模态大型语言模型在音频问答(AQA)、音频描述生成和自动语音识别等任务中展现出强大的能力,但存在模型会对音频内容产生幻觉的现象。为此,我们探测模型的内部状态,提出自适应向量引导(Adaptive Vector Steering, AVS)方法,以更好地将生成内容锚定在音频内容上。我们还识别到输出正确性与内部表征之间存在强相关性。实验表明,在两种模型和两种基准测试上该方法均表现出一致的性能提升。在Audio Hallucination QA数据集上,我们的方法将Gemma的F1分数从0.550提升至0.619,将Qwen的F1分数从0.626提升至0.632。此外,我们的方法将Qwen在MMAU上的准确率从0.548提升至0.592,实现了约8%的相对提升。据我们了解,这是首次将向量引导应用于缓解音频模型幻觉的工作。
引用
@article{arxiv.2510.12851,
title = {Adaptive vector steering: A training-free, layer-wise intervention for hallucination mitigation in large audio and multimodal models},
author = {Tsung-En Lin and Kuan-Yi Lee and Hung-Yi Lee},
journal= {arXiv preprint arXiv:2510.12851},
year = {2025}
}
备注
Note: This preprint is a version of the paper submitted to ICASSP 2026. The author list here includes contributors who provided additional supervision and guidance. The official ICASSP submission may differ slightly in author composition