中文

超越文本主导:理解 Omni-modal 大语言模型的模态偏好

人工智能 2026-04-30 v3

摘要

本地化 Omni-modal 大语言模型(OLLMs)已从管线架构转向统一的表示空间,但这种本土化集成引发了一个尚未充分探讨的关键现象:模态偏好。为填补这一空白,我们首先构建了新的基于冲突的基准测试,并提出了模态选择率指标,对OLLMs的模态偏好进行系统量化。我们评估了十个具有代表性的OLLMs,结果显示出显著的范式转变:与传统多模态视觉模型(VLMs)的“文本主导”不同,大多数OLLMs表现出显著的视觉偏好。为进一步理解其背后的机制,我们进行了层级探针分析,表明这种模态偏好并非静态,而是在中后期层中逐渐显现。基于这些洞见,我们利用这些内部信号来诊断跨模态幻觉,在三个下游多模态基准测试中实现了竞争性能,而无需任务特定数据。我们的工作提供了机制性理解以及构建更可信赖OLLMs的实用工具。我们的代码和相关资源已公开发布于:https://github.com/icip-cas/OmniPreference

关键词

引用

@article{arxiv.2604.16902,
  title  = {Beyond Text-Dominance: Understanding Modality Preference of Omni-modal Large Language Models},
  author = {Xinru Yan and Boxi Cao and Yaojie Lu and Hongyu Lin and Weixiang Zhou and Le Sun and Xianpei Han},
  journal= {arXiv preprint arXiv:2604.16902},
  year   = {2026}
}