通过语义课程偏好优化缓解多模态大语言模型中的视觉幻觉
计算机视觉与模式识别
2025-09-30 v1 人工智能
摘要
多模态大语言模型(MLLMs)在提升各种任务性能方面取得了显著进展,但仍然 suffer from visual hallucinations,即生成的响应与视觉证据相矛盾。这一问题尤为关键。虽然直接偏好优化(DPO)在对齐中广泛使用,但其应用于 MLLMs 往往无法捕捉细粒度语义差异,还会鼓励捷径学习。为此,我们提出了语义课程偏好优化(SCPO),一种 novel 的 MLLM 对齐框架。SCPO 基于语义课程偏好配对数据集构建渐进的、由易到难的课程,后者按难度排序提供细粒度语义对比。该框架采用动态参考模型和 novel 对称、双向目标函数,以便同时从文本和视觉偏好中进行学习。迄今为止,SCPO 是首个将语义、对称性和课程统一用于 MLLM 对齐的框架,有效缓解了视觉幻觉。广泛的实验表明,SCPO 在多个幻觉基准测试中表现优于基线模型,幻觉率降低最高可达 62.9%。此外,在通用基准测试上的评估显示,SCPO 在保持一般能力的同时提升了事实性,性能在各类通用视觉语言基准测试中保持稳定。
引用
@article{arxiv.2509.24491,
title = {Mitigating Visual Hallucinations via Semantic Curriculum Preference Optimization in MLLMs},
author = {Yuanshuai Li and Yuping Yan and Junfeng Tang and Yunxuan Li and Zeqi Zheng and Yaochu Jin},
journal= {arXiv preprint arXiv:2509.24491},
year = {2025}
}