解码与构架多模态大语言模型中的模态集成机制
计算机视觉与模式识别
2025-12-04 v2
摘要
尽管多模态大语言模型(MLLMs)取得了显著进展,但一个根本问题仍悬而未决:MLLMs对抗扰模态是否稳健?为严格研究此问题,我们引入MMA-Bench,包含视频及探测模型对特定模态依赖性的任务。运用黑箱与白箱可解释性技术,我们对开源与闭源MLLMs的脆弱性进行了关键性分析。我们发现当前MLLMs在不匹配的音频-视觉对及简单误导文本下表现不稳,因而缺乏稳健的多模态推理能力。基于这些发现,我们提出了一种模态对齐调谐策略,教会模型在何时优先、利用或忽略特定模态线索。通过大量实验与分析,我们表明该对齐调谐显著提升了多模态 grounding能力。这一工作提供了可解释性工具,并为开发具内在可靠跨模态推理能力的MLLMs提供了清晰路径。代码与数据集将公开释放。
引用
@article{arxiv.2511.22826,
title = {Some Modalities are More Equal Than Others: Decoding and Architecting Multimodal Integration in MLLMs},
author = {Tianle Chen and Chaitanya Chakka and Arjun Reddy Akula and Xavier Thomas and Deepti Ghadiyaram},
journal= {arXiv preprint arXiv:2511.22826},
year = {2025}
}