中文

MoD-DPO:使用模态解耦偏好优化缓解 Omni LLM 中的跨模态幻觉

计算机视觉与模式识别 2026-03-31 v2 计算与语言 机器学习

摘要

Omni 模态大语言模型 (omni LLM) 近期在音频视觉理解任务中取得了强大的性能,但仍高度易受源于虚假关联和主导语言先验的跨模态幻觉影响。本文提出模态解耦直接偏好优化 (MoD-DPO),一种简单有效的框架,用于改善 omni LLM 的模态对齐。MoD-DPO 引入模态感知正则化项,显式强制对无关模态损坏的不变性,以及对相关模态扰动的敏感性,从而减少意外的跨模态交互。为进一步缓解对文本先验的过度依赖,我们纳入一种语言先验去偏置惩罚,以阻止易导致幻觉的文本-only 响应。广泛的实验在多个音频视觉幻觉基准测试中表明,MoD-DPO 在感知准确性和幻觉抗性方面一致性改进,优于类似训练预算下的先前偏好优化基线。我们的发现凸显了模态忠实对齐的重要性,并展示了通向更可靠更具韧性多模态基础模型的可扩展路径。

关键词

引用

@article{arxiv.2603.03192,
  title  = {MoD-DPO: Towards Mitigating Cross-modal Hallucinations in Omni LLMs using Modality Decoupled Preference Optimization},
  author = {Ashutosh Chaubey and Jiacheng Pang and Mohammad Soleymani},
  journal= {arXiv preprint arXiv:2603.03192},
  year   = {2026}
}

备注

CVPR 2026. Project Page: https://mod-dpo.github.io/