中文

CoCoT:面向多图像输入大型多模态模型的对比式思维链提示

计算机视觉与模式识别 2024-01-08 v1

摘要

在探索通用人工智能 (AGI) 的发展过程中,此类模型的一项关键任务涉及解释和处理来自多个图像输入的信息。然而,大型多模态模型 (LMMs) 在此类场景中面临两个问题:(1) 缺乏细粒度感知能力,以及 (2) 倾向于混合多个图像间的信息。我们首先广泛调查了 LMMs 在处理多输入图像时感知细粒度视觉细节的能力。研究聚焦于两个方面:首先是图像到图像匹配(以评估 LMMs 是否能有效推理并配对相关图像),其次是多图像到文本匹配(以评估 LMMs 是否能准确捕捉并总结详细的图像信息)。我们在一系列开源和闭源大型模型上进行了评估,包括 GPT-4V、Gemini、OpenFlamingo 和 MMICL。为了提升模型性能,我们进一步开发了一种基于多输入多模态模型的对比式思维链 (CoCoT) 提示方法。该方法要求 LMMs 比较多个图像输入之间的异同,然后基于识别出的异同引导模型回答关于多图像输入的详细问题。我们的实验结果展示了 CoCoT 在增强大型多模态模型的多图像理解能力方面的熟练程度。

关键词

引用

@article{arxiv.2401.02582,
  title  = {CoCoT: Contrastive Chain-of-Thought Prompting for Large Multimodal Models with Multiple Image Inputs},
  author = {Daoan Zhang and Junming Yang and Hanjia Lyu and Zijian Jin and Yuan Yao and Mingkai Chen and Jiebo Luo},
  journal= {arXiv preprint arXiv:2401.02582},
  year   = {2024}
}