中文

学习融合:面向鲁棒多模态基础模型的模态感知自适应调度

计算机视觉与模式识别 2025-06-17 v1

摘要

多模态基础模型在广泛的视觉语言任务上取得了令人瞩目的进展。然而,现有方法通常采用固定或任务特定的融合策略,忽视了模态可靠性和样本复杂度的内在变异性。本文提出模态感知自适应融合调度(MA-AFS),一个能够逐实例动态调节各模态贡献的通用框架。MA-AFS引入一个轻量级神经调度器,通过整合视觉和文本熵信号以及跨模态一致性线索来预测模态融合权重。这使得模型能够自适应地强调更可靠的模态,尤其是在存在噪声、缺失或不对齐输入的情况下。我们将融合过程形式化为一个可微分的调度机制,分析其理论一致性和正则化效果,并证明它在不显著增加模型容量的情况下提升了鲁棒性。在图像-文本检索、描述生成和视觉问答上的大量实验表明,MA-AFS在CLIP、ALBEF和BLIP等强基线上实现了持续的性能提升。此外,MA-AFS在模态损坏下表现出增强的鲁棒性,并在域偏移下展现出更好的泛化能力。我们的工作强调了自适应融合的重要性,并为可靠且不确定性感知的多模态学习开辟了有前景的方向。

关键词

引用

@article{arxiv.2506.12733,
  title  = {Learning to Fuse: Modality-Aware Adaptive Scheduling for Robust Multimodal Foundation Models},
  author = {Liam Bennett and Mason Clark and Lucas Anderson and Hana Satou and Olivia Martinez},
  journal= {arXiv preprint arXiv:2506.12733},
  year   = {2025}
}