中文

无约束开放词汇图像分类:通过CLIP反向实现从文本到图像的零样迁移

计算机视觉与模式识别 2025-04-15 v4 人工智能 计算与语言

摘要

我们介绍了NOVIC,这是一个创新的实时无约束开放词汇图像分类器,使用自回归变换器生成性地输出分类标签作为语言。利用CLIP模型的广泛知识,NOVIC利用嵌入空间实现从纯文本到图像的零样迁移。传统的CLIP模型虽然具备开放词汇分类能力,但需要对潜在类别标签进行详尽的提示,从而限制了其在已知内容或上下文的图像上的应用。为此,我们提出了一个"对象解码器"模型,该模型在包含9200万目标的大规模模板化对象名词集和LLM生成的标题数据上训练,以始终输出所讨论的对象名词。这有效地反转了CLIP文本编码器,允许从图像派生的嵌入向量直接生成来自整个英语语言的文本对象标签,而无需对图像可能的内容进行任何先验知识,也不存在标签偏差。对训练好的解码器在混合手动和网页精选数据集以及标准图像分类基准上的测试表明,他们实现了最高达87.5%的细粒度无提示预测得分,考虑到模型必须为任何可能的图像工作且不依赖任何上下文线索,这是一个强有力的结果。

关键词

引用

@article{arxiv.2407.11211,
  title  = {Unconstrained Open Vocabulary Image Classification: Zero-Shot Transfer from Text to Image via CLIP Inversion},
  author = {Philipp Allgeuer and Kyra Ahrens and Stefan Wermter},
  journal= {arXiv preprint arXiv:2407.11211},
  year   = {2025}
}

备注

Published at WACV 2025