中文

CoTZero:基于层次化合成CoT的无标注类人视觉推理

人工智能 2026-02-10 v1 计算机视觉与模式识别

摘要

近期视觉语言模型(VLMs)的进展显著提升了图像-文本对齐,但仍不足以实现类人视觉推理。一个关键局限是许多VLMs依赖表面相关性,而非构建逻辑连贯的结构化表征,常导致遗漏更高层语义结构和非因果关系理解,阻碍了组合推理和可验证推理。为此,我们提出CoTZero,一种无标注的范式,包含两个组成部分:(i)双阶段数据合成方法,(ii)认知对齐训练方法。在第一个组成部分,我们借鉴了认知神经科学中关于组合生产力和全局到局部分析的观点。在底层阶段,CoTZero提取原子视觉原语并逐步组合成多样化的结构化问答-推理形式。在顶层阶段,它利用粗糙的全局结构指导对局部细节和因果关系的解释。在认知对齐训练组成部分,基于合成的CoT数据,我们引入认知一致可验证奖励(CCVR)进行强化微调(RFT),进一步强化VLMs的层次推理和泛化能力,提供关于推理连贯性和事实正确性的逐步反馈。实验表明,CoTZero在我们构建的多层语义不一致基准上实现了83.33%的F1得分,采用词汇扰动负样本,适用于域内和域外设置。消融实验确认,每个组成部分都有助于更具可解释性和类人化的视觉推理。

关键词

引用

@article{arxiv.2602.08339,
  title  = {CoTZero: Annotation-Free Human-Like Vision Reasoning via Hierarchical Synthetic CoT},
  author = {Chengyi Du and Yazhe Niu and Dazhong Shen and Luxin Xu},
  journal= {arXiv preprint arXiv:2602.08339},
  year   = {2026}
}

备注

16 pages 6 figures