中文

CIMR:面向大型视觉语言模型中鲁棒指令遵循的情境化迭代多模态推理

机器学习 2025-07-31 v1 计算与语言

摘要

大型语言模型(LLMs)和大型视觉语言模型(LVLMs)的快速发展增强了我们处理和生成人类语言和视觉信息的能力。然而,这些模型在需要逻辑推理、动态反馈集成和迭代自我纠正的复杂多步骤多模态指令方面常常表现不佳。为此,我们提出了 CIMR:情境化迭代多模态推理,一种新型框架,引入了情境感知的迭代推理和自我纠正模块。CIMR 在两个阶段运行:初始推理与响应生成,随后通过解析的多模态反馈进行迭代细化。在每个步骤中,动态融合模块深入集成文本、视觉和情境特征。我们在 Visual Instruction Tuning (VIT) 数据集上微调 LLaVA-1.5-7B,并在新引入的 Multi-modal Action Planning (MAP) 数据集上评估 CIMR。CIMR 实现了 91.5% 的准确率,超过 GPT-4V (89.2%)、LLaVA-1.5 (78.5%)、MiniGPT-4 (75.3%) 和 InstructBLIP (72.8%) 等最新模型,展示了其在复杂任务中迭代推理和自我纠正能力的有效性。

关键词

引用

@article{arxiv.2507.22074,
  title  = {CIMR: Contextualized Iterative Multimodal Reasoning for Robust Instruction Following in LVLMs},
  author = {Yangshu Yuan and Heng Chen and Xinyi Jiang and Christian Ng and Kexin Qiu},
  journal= {arXiv preprint arXiv:2507.22074},
  year   = {2025}
}