中文

Cantor:激发多模态大语言模型的思维链

计算机视觉与模式识别 2024-04-25 v1 计算与语言

摘要

随着由思维链(CoT)方法增强的大语言模型(LLM)的出现,视觉推理问题通常被分解为可管理的子任务,并依次使用各种外部工具解决。然而,这种范式面临着决策中潜在“确定性幻觉”的挑战,原因是视觉信息不足以及低级感知工具无法提供全面推理所需的抽象摘要。我们认为,融合视觉上下文获取和逻辑推理是解决视觉推理任务的关键。本文深入探讨多模态CoT领域,利用多模态大语言模型(MLLM)及其认知能力解决复杂的视觉推理任务。为此,我们提出了一种创新的多模态CoT框架,称为Cantor,其特点是感知-决策架构。Cantor首先作为决策生成器,整合视觉输入以分析图像和问题,确保与实际上下文更紧密地对齐。此外,Cantor利用MLLM的高级认知功能作为多面专家,用于推导更高级别的信息,增强CoT生成过程。我们的大量实验证明了所提出框架的有效性,在两个复杂的视觉推理数据集上,多模态CoT性能显著提升,且无需微调或真实理由。项目页面:https://ggg0919.github.io/cantor/。

关键词

引用

@article{arxiv.2404.16033,
  title  = {Cantor: Inspiring Multimodal Chain-of-Thought of MLLM},
  author = {Timin Gao and Peixian Chen and Mengdan Zhang and Chaoyou Fu and Yunhang Shen and Yan Zhang and Shengchuan Zhang and Xiawu Zheng and Xing Sun and Liujuan Cao and Rongrong Ji},
  journal= {arXiv preprint arXiv:2404.16033},
  year   = {2024}
}

备注

The project page is available at https://ggg0919.github.io/cantor/