中文

Visual CoT:结合综合数据集与思维链推理基准推进多模态语言模型

计算机视觉与模式识别 2024-11-05 v3

摘要

多模态大语言模型(MLLM)在各种 VQA 任务中展现了出色的性能。然而,它们通常缺乏可解释性,并且在处理复杂视觉输入时存在困难,尤其是当输入图像分辨率较高,或者能够提供回答问题关键信息的目标区域较小时。为了应对这些挑战,我们收集并引入了大规模 Visual CoT 数据集,包含 438k 个问答对,并标注了中间边界框以突出对回答问题至关重要的关键区域。此外,其中约 98k 个问答对标注了详细的推理步骤。重要的是,我们提出了一种多轮处理流水线,能够动态聚焦视觉输入并提供可解释的思考过程。我们还引入了相关基准,以在需要特定局部区域识别的场景下评估 MLLM。大量实验证明了我们框架的有效性,并为更好的推理策略提供了启示。Visual CoT 数据集、基准和预训练模型可在 https://hao-shao.com/projects/viscot.html 获取,以支持该领域的进一步研究。

关键词

引用

@article{arxiv.2403.16999,
  title  = {Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning},
  author = {Hao Shao and Shengju Qian and Han Xiao and Guanglu Song and Zhuofan Zong and Letian Wang and Yu Liu and Hongsheng Li},
  journal= {arXiv preprint arXiv:2403.16999},
  year   = {2024}
}

备注

Project Page: https://hao-shao.com/projects/viscot.html