中文

理解分布偏移下的多模态LLM:一种信息论方法

人工智能 2025-05-27 v2 计算与语言 机器学习

摘要

多模态大语言模型(MLLMs)已展现出有前景的能力,但在分布偏移下表现不佳,即评估数据与指令微调分布不同。尽管先前的工作提供了实证评估,但我们认为,建立一个能够表征和量化MLLM风险的形式化框架,对于确保MLLM在现实世界中的安全可靠应用是必要的。通过采用信息论的视角,我们提出了第一个理论框架,该框架能够量化分布偏移下MLLM的最大风险。我们框架的核心是引入了有效互信息(EMI),这是一个有原则的度量标准,用于量化输入查询与模型响应之间的相关性。我们推导了分布内(ID)和分布外(OOD)数据之间EMI差异的上界,并将其与视觉和文本分布差异联系起来。在涵盖61个偏移场景的真实基准数据集上进行的大量实验,实证验证了我们的理论见解。

关键词

引用

@article{arxiv.2502.00577,
  title  = {Understanding Multimodal LLMs Under Distribution Shifts: An Information-Theoretic Approach},
  author = {Changdae Oh and Zhen Fang and Shawn Im and Xuefeng Du and Yixuan Li},
  journal= {arXiv preprint arXiv:2502.00577},
  year   = {2025}
}

备注

ICML 2025 camera-ready