面向可信赖的多模态大语言模型对齐的模态公平偏好优化
计算机视觉与模式识别
2025-06-09 v2
摘要
多模态大语言模型(MLLM)在各类任务中取得了显著成功。然而,独立训练视觉和文本编码器常常导致模态间错位。这种错位可能导致模型生成与输入图像无关的内容,称为幻觉(hallucination)。这些误差严重削弱了 MLLM 在实际应用中的可信赖性。尽管尝试通过优化文本偏好来缓解此问题,但我们的最初调查表明,MLLM 的可信赖性仍不足。具体而言,这些模型即使输入图像被严重扭曲,仍倾向于提供受偏好的答案。对视觉标记注意力的分析也表明,模型主要关注问题周围的上下文,而非关键被提问的对象。这些发现凸显了模态间的错位,表明答案未充分利用输入图像。基于我们的发现,我们提出了模态公平偏好优化(Modality-Fair Preference Optimization, MFPO),其包含三个组成部分:构建一种模态偏好数据集,其中被否定的图像仅在关键区域与原图不同;设计一种图像奖励损失函数,鼓励模型生成更符合输入图像的答案;以及一种易到难的迭代对齐策略,以稳定联合模态训练。对三个可信赖性基准进行大量实验表明,MFPO显著提升了 MLLM 的可信赖性。特别是,它使 7B 参数模型的可信赖性水平达到乃至超越 13B、34B 和更大模型的水平。
引用
@article{arxiv.2410.15334,
title = {Modality-Fair Preference Optimization for Trustworthy MLLM Alignment},
author = {Songtao Jiang and Yan Zhang and Ruizhe Chen and Tianxiang Hu and Yeying Jin and Qinglin He and Yang Feng and Jian Wu and Zuozhu Liu},
journal= {arXiv preprint arXiv:2410.15334},
year = {2025}
}