中文

OmniDPO:面向 Omni-Modal 幻觉的偏好优化框架

人工智能 2025-09-03 v1 多媒体

摘要

最近,Omni-modal 大语言模型(OLLM)引领了新的研究浪潮,在音频-视频理解和实时环境感知等任务中取得了令人瞩目的成果。然而,幻觉问题仍然存在。类似双模态设置,文本模态的先验倾向于占主导,导致 OLLM 更依赖文本线索而忽略视觉和音频信息。此外,完全多模态场景引入了新挑战。大多数现有模型在训练时独立地将视觉或听觉模态与文本对齐,忽略了视频及其对应音频之间的内在相关性。这一误疏导致在需要解释视频内容中隐藏的音频线索时出现幻觉。为解决这些挑战,我们提出 OmniDPO,一个针对 OLLM 幻觉的偏好对齐框架。具体而言,OmniDPO 包含两种策略:(1)构建文本偏好样本对以增强模型对音频-视频交互的理解;(2)构建多模态偏好样本对以强化模型对视觉和听觉信息的注意力。通过同时应对这两种挑战,OmniDPO 有效改进了多模态 grounding 并减少了幻觉。在两款 OLLM 上的实验表明,OmniDPO 不仅有效缓解了多模态幻觉,还显著提升了模型在各模态之间的推理能力。所有代码和数据集将在论文接受后公开。

关键词

引用

@article{arxiv.2509.00723,
  title  = {OmniDPO: A Preference Optimization Framework to Address Omni-Modal Hallucination},
  author = {Junzhe Chen and Tianshu Zhang and Shiyu Huang and Yuwei Niu and Chao Sun and Rongzhou Zhang and Guanyu Zhou and Lijie Wen and Xuming Hu},
  journal= {arXiv preprint arXiv:2509.00723},
  year   = {2025}
}