中文

多模态大型语言模型中的跨模态一致性

计算与语言 2024-11-15 v1 人工智能

摘要

多模态方法的最新发展标志着一个令人兴奋的时代的开始,这个时代的模型擅长处理包括文本、音频和视觉内容在内的多种数据类型。像GPT-4V这样将计算机视觉与高级语言处理相结合的模型,在处理需要同时理解文本和视觉信息的复杂任务方面展现出了非凡的能力。先前的研究工作仔细评估了这些视觉大型语言模型在各个领域的效能,包括目标检测、图像描述和其他相关领域。然而,现有的分析往往存在局限性,主要集中在孤立地评估每种模态的性能,而忽略了探索它们之间复杂的跨模态交互。具体而言,当这些模型面对跨不同模态的相同任务实例时,是否能达到相同的准确度水平,这个问题仍然没有答案。在本研究中,我们主动深入探讨这些目标模态之间的交互和比较,引入了一个称为跨模态一致性的新概念。此外,我们提出了一个基于此概念的定量评估框架。我们的实验结果来自我们开发的精选平行视觉-语言数据集,揭示了GPT-4V内部视觉和语言模态之间存在明显的不一致性,尽管它被描绘为一个统一的多模态模型。我们的研究为这类模型的适当使用提供了见解,并暗示了增强其设计的潜在途径。

关键词

引用

@article{arxiv.2411.09273,
  title  = {Cross-Modal Consistency in Multimodal Large Language Models},
  author = {Xiang Zhang and Senyu Li and Ning Shi and Bradley Hauer and Zijun Wu and Grzegorz Kondrak and Muhammad Abdul-Mageed and Laks V. S. Lakshmanan},
  journal= {arXiv preprint arXiv:2411.09273},
  year   = {2024}
}