中文

CogCoM:一种具备操作链推理能力的视觉语言模型

计算机视觉与模式识别 2025-03-04 v3 计算与语言

摘要

视觉语言模型(VLMs)凭借在将视觉指令与响应对齐方面的广泛训练,展现了其广泛的效力。然而,这种结论性对齐的训练导致模型忽略关键的视觉推理,进而导致在精细视觉问题上的失败以及响应不忠实。受人类解决视觉问题认知过程(例如标记、放大)的启发,本文引入了“操作链”(Chain of Manipulations)机制,使 VLM 能够逐步利用证据解决问题。经过训练后,模型可以通过主动激发内在操作(例如定位、放大)并获取结果(例如边界框、图像)来解决各种视觉问题,无需涉及外部工具,同时允许用户追踪错误原因。我们研究了实现该机制的路线图,包括:(1) 基于广泛分析的操作灵活设计;(2) 高效的自动化数据生成流水线;(3) 支持多轮多图像的兼容 VLM 架构;以及 (4) 用于多功能能力的模型训练过程。基于该设计,我们还手动标注了 6K 个高质量样本,用于具有挑战性的图形数学问题。我们训练的模型 CogCoM 拥有 170 亿参数并配备此机制,在来自 4 个类别的 9 个基准测试中取得了最先进(SOTA)的性能,证明了其有效性同时保持了可解释性。我们的代码、模型权重和收集的数据已在 https://github.com/THUDM/CogCoM 公开。

关键词

引用

@article{arxiv.2402.04236,
  title  = {CogCoM: A Visual Language Model with Chain-of-Manipulations Reasoning},
  author = {Ji Qi and Ming Ding and Weihan Wang and Yushi Bai and Qingsong Lv and Wenyi Hong and Bin Xu and Lei Hou and Juanzi Li and Yuxiao Dong and Jie Tang},
  journal= {arXiv preprint arXiv:2402.04236},
  year   = {2025}
}

备注

21 pages, 10 figures