通过噪声感知偏好优化消除多模态大语言模型的偏见
计算机视觉与模式识别
2025-03-25 v1 计算与语言
摘要
多模态大语言模型在各类任务中表现突出,但常面临模态偏见问题,即模型倾向于依赖单一模态而忽视其他模态中关键信息,导致注意力错误且生成无关响应。本文提出使用偏好优化范式来解决模态偏见问题,包括RLAIFVBias——一个消除偏见的偏好优化数据集,以及噪声感知偏好优化算法。具体而言,我们通过引入扰动来构建数据集,以减少某些模态的信息量,迫使模型在生成负面响应时依赖于特定模态。为解决自动构建数据中不可避免的噪声,我们将噪声鲁棒的平均绝对误差与直接偏好优化中的二元交叉熵结合起来,并通过负Box Cox变换,根据数据中评估的噪声水平动态调整算法的噪声鲁棒性。广泛的实验验证了我们方法的有效性,结果表明该方法不仅在减轻模态偏见方面具有显著作用,而且在最小化幻觉方面也发挥着重要作用。
引用
@article{arxiv.2503.17928,
title = {Debiasing Multimodal Large Language Models via Noise-Aware Preference Optimization},
author = {Zefeng Zhang and Hengzhu Tang and Jiawei Sheng and Zhenyu Zhang and Yiming Ren and Zhenyang Li and Dawei Yin and Duohe Ma and Tingwen Liu},
journal= {arXiv preprint arXiv:2503.17928},
year = {2025}
}
备注
CVPR 2025