中文

论多模态大型语言模型的分布外泛化能力

计算机视觉与模式识别 2024-02-12 v1 人工智能

摘要

我们通过分布外场景和特定领域任务的综合评估,研究了当前多模态大型语言模型(MLLM)的泛化边界。我们评估了它们在合成图像、现实世界分布偏移以及专业和分子成像等专用数据集上的零样本泛化能力。实证结果表明,MLLM 难以泛化到常见训练领域之外,限制了其未经适应的直接应用。为了理解性能不可靠的原因,我们分析了三个假设:语义误解、视觉特征提取不足和映射缺陷。结果确定映射缺陷是主要障碍。为解决这一问题,我们展示了上下文学习(ICL)可以显著增强 MLLM 的泛化能力,为克服泛化障碍开辟了新途径。我们进一步探讨了 ICL 在分布偏移下的鲁棒性,并展示了其对领域偏移、标签偏移以及上下文示例与测试数据之间虚假相关偏移的脆弱性。

关键词

引用

@article{arxiv.2402.06599,
  title  = {On the Out-Of-Distribution Generalization of Multimodal Large Language Models},
  author = {Xingxuan Zhang and Jiansheng Li and Wenjing Chu and Junjia Hai and Renzhe Xu and Yuqing Yang and Shikai Guan and Jiazheng Xu and Peng Cui},
  journal= {arXiv preprint arXiv:2402.06599},
  year   = {2024}
}