中文

面向大型多模态模型的组合思维链提示

计算机视觉与模式识别 2024-04-02 v3 人工智能 计算与语言 机器学习

摘要

强大视觉骨干与大型语言模型(LLM)推理的结合,使大型多模态模型(LMMs)成为广泛视觉与语言(VL)任务当前的标准。然而,近期研究表明即使最先进的 LMM 仍难以捕捉组合视觉推理的某些方面,如物体属性与关系。一种解决方案是利用场景图(SGs)——一种物体及其关系与属性的形式化表示,已广泛用作视觉与文本域间的桥梁。但场景图数据需场景图标注,收集昂贵因而难以扩展。此外,基于 SG 数据微调 LMM 可能导致对预训练目标的灾难性遗忘。为克服此问题,受思维链方法启发,我们提出组合思维链(CCoT),一种新颖的零样本思维链提示方法,利用 SG 表征从 LMM 提取组合知识。具体而言,我们首先用 LMM 生成 SG,再将该 SG 用于提示以产生响应。通过大量实验,我们发现所提 CCoT 方法不仅提升 LMM 在若干 VL 组合基准上的性能,也提升若干流行 LMM 在通用多模态基准上的性能,且无需微调或带标注真值 SG。代码:https://github.com/chancharikmitra/CCoT

关键词

引用

@article{arxiv.2311.17076,
  title  = {Compositional Chain-of-Thought Prompting for Large Multimodal Models},
  author = {Chancharik Mitra and Brandon Huang and Trevor Darrell and Roei Herzig},
  journal= {arXiv preprint arXiv:2311.17076},
  year   = {2024}
}