中文

通过重构与文本描述对齐提升 CLIP 中的构成推理能力

计算机视觉与模式识别 2025-10-21 v1 人工智能

摘要

尽管近期进展显著,视觉语言模型在标准对比学习目标下仍难以实现构成推理——即理解视觉元素与语言元素之间结构化关系的能力。这主要源于文本编码器倾向于关注 individual单词而非其关系,受对比学习强化——该学习主要对齐单词与视觉物体——的限制。在本文中,我们引入 REconstruction and Alignment of text Descriptions (READ),一种 fine-tuning方法,通过添加两个辅助目标提升构成推理:(1) 基于 original caption embedding 的 frozen预训练解码器重构 alternative caption;(2) 显式对齐 paraphrased句子在嵌入空间中的表示。我们表明,应用 READ 方法得到的 READ-CLIP 在五大构成推理基准测试中实现 SOTA 性能,相较 strongest conventional fine-tuning baseline 最高提升 4.1%。将 READ 应用于现有 CLIP 变体(包括 NegCLIP 和 FSC-CLIP)亦能提升这些基准测试的表现。定量与定性分析揭示,所提目标——重构与对齐——提供互补收益:前者鼓励编码器捕获 caption内单词间关系,后者确保不同措辞表达的 paraphrase句子具有一致表示。

关键词

引用

@article{arxiv.2510.16540,
  title  = {Enhancing Compositional Reasoning in CLIP via Reconstruction and Alignment of Text Descriptions},
  author = {Jihoon Kwon and Kyle Min and Jy-yong Sohn},
  journal= {arXiv preprint arXiv:2510.16540},
  year   = {2025}
}

备注

Accepted at NeurIPS 2025 (poster). This is the camera-ready version