多模态大语言模型中模态偏好的评估与引导
计算与语言
2026-02-05 v3
摘要
多模态大语言模型(MLLMs)在复杂的多模态任务上取得了显著成功。然而,它们在处理多模态上下文时是否表现出 (即倾向于偏好某一种模态胜过另一种)仍未得到充分探索。为了研究这一问题,我们引入了 基准,该基准构建了受控的证据冲突场景,以系统地评估决策中的模态偏好。大量实验表明,所有 20 个受测 MLLMs 普遍表现出明确的模态偏好,并且这种偏好可以作为 MLLMs 下游任务性能的有用指标。进一步分析表明,模态偏好可以通过指令引导进行控制,并被捕获在 MLLMs 的潜在表示中。基于这些见解,我们提出了一种基于表示工程的探测与引导方法,以在无需额外微调的情况下显式控制模态偏好。该方法有效地将模态偏好向期望方向放大,并在多个多模态理解与推理任务中展现出可喜的改进。
引用
@article{arxiv.2505.20977,
title = {Evaluating and Steering Modality Preferences in Multimodal Large Language Model},
author = {Yu Zhang and Jinlong Ma and Yongshuai Hou and Xuefeng Bai and Kehai Chen and Yang Xiang and Jun Yu and Min Zhang},
journal= {arXiv preprint arXiv:2505.20977},
year = {2026}
}
备注
Modality Preference