中文

基于渐进式语言观测的组合零样本学习

计算机视觉与模式识别 2025-08-18 v2

摘要

组合零样本学习旨在利用训练时已知的基元(状态与物体)识别未见的 state-object 组合。然而,有效建模基元间交互并将知识泛化至新颖组合仍是一贯挑战。存在两个关键因素:物体条件方差与状态条件方差,即状态(或物体)的外观在与不同物体(或状态)组合时可能有显著差异。例如,状态“old”对于“car”可表示复古设计,对于“cat”可表示高龄。本文认为,这些方差可通过基于预观测基元预测组合类别来缓解。为此,我们提出渐进式语言观测(PLO),其能动态确定更优的基元观测顺序。这些观测由一系列概念或语言组成,使模型得以逐步理解图像内容。具体而言,PLO 采用预训练视觉-语言模型(VLMs)赋予模型观测能力。我们进一步设计两种变体:1)PLO-VLM:一种两步法,其中预观测分类器动态确定两个基元的观测顺序。2)PLO-LLM:一种多步方案,利用大语言模型(LLMs)定制组合特定提示以逐步观测。在三个具挑战性数据集上的大量消融实验证明了 PLO 相较 SOTA 方法的优越性,确证了其在组合识别中的能力。

关键词

引用

@article{arxiv.2311.14749,
  title  = {Compositional Zero-shot Learning via Progressive Language-based Observations},
  author = {Lin Li and Guikun Chen and Zhen Wang and Jun Xiao and Long Chen},
  journal= {arXiv preprint arXiv:2311.14749},
  year   = {2025}
}