中文

解码与构架多模态大语言模型中的模态集成机制

计算机视觉与模式识别 2025-12-04 v2

摘要

尽管多模态大语言模型(MLLMs)取得了显著进展,但一个根本问题仍悬而未决:MLLMs对抗扰模态是否稳健?为严格研究此问题,我们引入MMA-Bench,包含视频及探测模型对特定模态依赖性的任务。运用黑箱与白箱可解释性技术,我们对开源与闭源MLLMs的脆弱性进行了关键性分析。我们发现当前MLLMs在不匹配的音频-视觉对及简单误导文本下表现不稳,因而缺乏稳健的多模态推理能力。基于这些发现,我们提出了一种模态对齐调谐策略,教会模型在何时优先、利用或忽略特定模态线索。通过大量实验与分析,我们表明该对齐调谐显著提升了多模态 grounding能力。这一工作提供了可解释性工具,并为开发具内在可靠跨模态推理能力的MLLMs提供了清晰路径。代码与数据集将公开释放。

关键词

引用

@article{arxiv.2511.22826,
  title  = {Some Modalities are More Equal Than Others: Decoding and Architecting Multimodal Integration in MLLMs},
  author = {Tianle Chen and Chaitanya Chakka and Arjun Reddy Akula and Xavier Thomas and Deepti Ghadiyaram},
  journal= {arXiv preprint arXiv:2511.22826},
  year   = {2025}
}