中文

一种捕获语言空间中组合知识新方法

计算机视觉与模式识别 2026-05-29 v1

摘要

组合理解允许视觉语言模型解释图像和文本中对象、属性及关系的复杂关系。然而,大多数现有方法通常依赖硬负例和微调,这会导致改进被高估,且受限于获取硬负例的困难。本文引入一种无硬负训练数据的零样本组合理解(ZS-CU)新任务,通过不要求硬负例训练数据来增强组合理解能力。我们提出了 YUKINO(Yielded Compositional Understanding Knowledge via Textual Inversion with NO),其通过文本内置将无标签图像映射到预训练 CLIP 模型中的伪标记,实现了组合理解知识的捕获。我们提出引入“no”逻辑正则化以解决标记在内置过程中相互作用的问题。此外,我们建议采用知识蒸馏以降低文本内置的时间复杂性。实验结果表明,YUKINO 在 SugarCREPE 数据集上超越现有多模态 SOTA 模型超过 8%,在图像检索任务中也取得显著改进。

关键词

引用

@article{arxiv.2412.15632,
  title  = {A New Method to Capturing Compositional Knowledge in Linguistic Space},
  author = {Jiahe Wan},
  journal= {arXiv preprint arXiv:2412.15632},
  year   = {2026}
}