中文

如果你能描述它,他们就能看见:从文本描述扩展视觉概念的跨模态学习

计算机视觉与模式识别 2025-12-18 v2

摘要

人类可以根据经验和先前知识,从自然语言描述中构建新颖且未知的概念的可视化能力。以此为灵感,我们提出了一种方法,扩展了这种能力到视觉-语言模型(VLMs),仅通过文本描述教授它们新概念。我们将这种方法称为知识迁移(Knowledge Transfer, KT)。我们的假设是,预训练 VLMs 的知识可以被重用来表示以前未知的概念。通过给定的新概念的文本描述,KT 通过对齐视觉编码器获得的相关特征(通过模型反向传播获得),与其文本表示进行对齐。不同于依赖视觉示例或外部生成模型的方法,KT 能在同一 VLMs 内部通过从文本直接注入视觉知识来实现知识迁移。通过对多个 VLMs 任务的广泛评估,包括分类、分割、图像-文本检索和描述,我们显示:1)KT 能高效地从单个文本描述中引入新的视觉概念;2)同一原理可用于细化现有概念的表示;3)KT 显著提高了零样象 VLMs 的性能。

关键词

引用

@article{arxiv.2411.15611,
  title  = {If you can describe it, they can see it: Cross-Modal Learning of Visual Concepts from Textual Descriptions},
  author = {Carlo Alberto Barbano and Luca Molinaro and Massimiliano Ciranni and Emanuele Aiello and Vito Paolo Pastore and Marco Grangetto},
  journal= {arXiv preprint arXiv:2411.15611},
  year   = {2025}
}

备注

27 pages. Under review