中文

相同内容,不同答案:多模态大语言模型中的跨模态不一致性

人工智能 2026-04-23 v2

摘要

我们引入了两个新基准 REST 和 REST+(渲染等价性压力测试),以系统评估多模态大语言模型(MLLMs)中的跨模态不一致性。MLLMs 被训练在同一嵌入空间中表示视觉和语言,但它们无法在两种模态中执行相同任务。我们的基准包含三种模态(图像、文本、混合)中具有相同语义信息的样本,我们发现最先进的多模态大语言模型无法在这些不同模态上一致地进行推理。我们评估了 15 个 MLLM,发现模态不一致性的程度差异很大,即使考虑到文本识别(OCR)问题也是如此。将文本渲染为图像或将图像渲染为文本都无法解决这种不一致性。即使 OCR 正确,我们发现视觉特征(文本颜色和分辨率,但非字体)和视觉 token 数量会影响模型性能。最后,我们发现一致性分数与文本和图像之间的模态差距相关,揭示了跨模态不一致 MLLM 的机制性解释。

关键词

引用

@article{arxiv.2512.08923,
  title  = {Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs},
  author = {Angela van Sprang and Laurens Samson and Ana Lucic and Erman Acar and Sennay Ghebreab and Yuki M. Asano},
  journal= {arXiv preprint arXiv:2512.08923},
  year   = {2026}
}

备注

Accepted at CVPR 2026. Angela van Sprang and Laurens Samson contributed equally as first authors