中文

在多模态大语言模型中引导思维链以实现数据高效的模型适配

计算机视觉与模式识别 2025-07-04 v1

摘要

多模态大语言模型(MLLM)在利用自然语言解释图像方面展现了卓越的能力。然而,如果不使用大规模数据集进行重新训练,这些模型很难适配到专门的视觉任务,例如图表理解。这个问题是由预训练数据集和下游数据集之间的不匹配造成的:预训练数据集主要关注场景和物体,但包含的关于专门的非物体图像(如图表和表格)的信息有限。在本文中,我们分享了一个有趣的发现:使用思维链(CoT)推理数据训练MLLM可以促进其在专门视觉任务中的模型适配,尤其是在数据有限的条件下。然而,我们发现在从预训练MLLM中提取的CoT数据中存在一个关键问题,即这些数据在推理步骤中常常包含多个事实性错误。为了解决这个问题,我们提出了引导思维链(GCoT),一种简单的基于引导的方法,旨在将引导信息(即边界框)注入CoT数据,从而使推理步骤更忠实于输入图像。我们在五个专门的视觉任务上评估了我们的方法,这些任务涵盖了多种视觉格式,包括图表、表格、收据和报告。结果表明,在数据有限的条件下,我们的方法显著优于微调和蒸馏方法。

关键词

引用

@article{arxiv.2507.02859,
  title  = {Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation},
  author = {Jiaer Xia and Bingkui Tong and Yuhang Zang and Rui Shao and Kaiyang Zhou},
  journal= {arXiv preprint arXiv:2507.02859},
  year   = {2025}
}

备注

Accepted by ICCV2025