中文

VoCoT:在大型多模态模型中解放视觉 grounding 多步推理

计算机视觉与模式识别 2025-03-11 v3 人工智能 计算与语言

摘要

虽然大型多模态模型(LMM)在各种任务上展现出惊人的能力,但其处理复杂任务的效果受限于当前的单步推理范式。为此,本文提出了 VoCoT,一种针对 LMM 推理的多步骤视觉 grounding object-centric Chain-of-Thought 推理框架。VoCoT 的两个关键特征为:(1)围绕跨模态共享对象级信息的 object-centric 推理路径;(2)以多模态交错对齐的方式表征对象概念的视觉 grounding 表示,有效地在 LMM 的长期生成期间弥合了模态间的鸿沟。为适配 LMM 在 VoCoT 推理中,我们进一步构建了一个指令调谖数据集。通过将 VoCoT 与主流开源 LMM 架构结合,我们开发了一个基于 VoCoT 的模型,VolCano。仅需 7B 参数和有限的输入图像分辨率,VolCano 在各种场景下均表现出色。在需要复杂推理能力的基准测试如 CLEVR 和 EmbSpatial 中,VolCano 超过了包括 GPT-4V 在内的 SOTA 模型。相关代码、数据和模型已发布于 https://github.com/RupertLuo/VoCoT。

关键词

引用

@article{arxiv.2405.16919,
  title  = {VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models},
  author = {Zejun Li and Ruipu Luo and Jiwen Zhang and Minghui Qiu and Xuanjing Huang and Zhongyu Wei},
  journal= {arXiv preprint arXiv:2405.16919},
  year   = {2025}
}

备注

Accepted by NAACL 2025 main conference