先分离,后融合:利用特定模态思维链缓解音视频大语言模型推理中的跨模态干扰
人工智能
2026-05-12 v1 声音
摘要
音频和视觉为音视频问答提供了互补证据,然而当前的音视频大语言模型可能会遭受跨模态干扰:来自一种模态的信息会误导对另一种模态的解释,从而引发幻觉。我们将此问题归因于中间推理过程中不受控的跨模态交互。为缓解该问题,我们提出了“先分离,后融合”(Separate First, Fuse Later, SFFL),这是一个旨在减少跨模态干扰的音视频推理框架。SFFL 强制执行特定模态的思维链推理,生成独立的音频和视觉推理轨迹,并整合证据以回答问题。我们通过在不同模态输入设置下的数据管线构建了模态偏好标签。我们将这些标签作为强化学习中的辅助奖励,以鼓励在回答时产生依赖于实例的模态线索偏好。我们进一步引入了一种特定模态推理机制,该机制在分离推理阶段保持模态隔离,同时在证据融合阶段允许充分访问跨模态信息。实验表明,准确率和鲁棒性均取得了一致的提升,在通用 AVQA 基准上获得了 5.16% 的平均相对增益,在跨模态幻觉基准上获得了 11.17% 的平均相对增益。
引用
@article{arxiv.2605.09906,
title = {Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought},
author = {Xuanchen Li and Yuheng Lu and Chenrui Cui and Tianrui Wang and Zikang Huang and Yu Jiang and Long Zhou and Longbiao Wang and Jianwu Dang},
journal= {arXiv preprint arXiv:2605.09906},
year = {2026}
}