面向多模态大语言模型的 Grounded Chain-of-Thought
计算机视觉与模式识别
2025-03-25 v2 多媒体
摘要
尽管取得了显著进展,现有的多模态大语言模型(MLLM)仍容易产生视觉幻觉,这严重阻碍了其可靠应用。在本文中,我们从视觉-空间推理的角度切入,提出一种新的学习任务用于 MLLM,称为 Grounded Chain-of-Thought(GCoT)。不同于最近的视觉 CoT 研究侧重于视觉知识推理,GCoT 更倾向于帮助 MLLM逐步识别并 grounding 相关视觉线索,从而以 grounding 坐标为基础预测正确答案。为便于此任务,我们仔细设计并构建了一个名为多模态 grounding chain-of-thought(MM-GCoT)的数据集,包含 24,022 个 GCoT 示例,覆盖 5,033 张图片。此外,我们还引入了一套全面的一致性评估体系,包括答案准确率、grounding 准确率和 answer-grounding 一致性等指标。我们进一步设计并在 12 个先进 MLLM 上进行大量实验,揭示了若干值得注意的发现:i. 大多数 MLLM 在一致性评估中表现不佳,表明存在明显的视觉幻觉;ii. 视觉幻觉与参数规模和通用多模态性能并无直接关联,即大型且功能强的 MLLM 也不免受此问题影响。最后,我们还展示了所提数据集能够帮助现有 MLLM 良好培养其 GCoT 能力并显著降低不一致性答复。此外,其 GCoT 也可推广至现有的多模态任务,如开放式问答和 REC。
引用
@article{arxiv.2503.12799,
title = {Grounded Chain-of-Thought for Multimodal Large Language Models},
author = {Qiong Wu and Xiangcong Yang and Yiyi Zhou and Chenxin Fang and Baiyang Song and Xiaoshuai Sun and Rongrong Ji},
journal= {arXiv preprint arXiv:2503.12799},
year = {2025}
}