多类文本反转隐式产生语义无关分类器
计算机视觉与模式识别
2024-10-30 v1
摘要
随着CLIP等大型预训练视觉-语言模型的出现,提示学习方法旨在增强CLIP模型的迁移能力。它们利用下游任务中的少量样本,并以特定类别名称作为先验知识来学习提示,我们称之为语义感知分类。然而,在许多现实场景中,我们只能访问少量样本和类别名称的知识(例如,当考虑类别的实例时)。这种具有挑战性的场景代表了语义无关的判别情况。文本到图像(T2I)个性化方法旨在通过学习新的标记并赋予这些标记生成所学概念的能力,使T2I模型适应未见过的概念。这些方法不需要类别名称的知识作为语义感知先验。因此,在本文中,我们首先探索了文本反转,并通过将每个类别视为一个单一概念,揭示了新的概念标记同时具备生成和分类能力。然而,从单概念文本反转中学习分类器是有限的,因为学习到的标记对于判别任务而言是次优的。为了缓解这个问题,我们提出了多类文本反转,它在标记更新过程中包含了一个判别正则化项。利用这种技术,我们的方法MC-TI在仅给定每个类别少量样本的情况下,实现了更强的语义无关分类能力,同时保留了这些修饰标记的生成能力。在实验中,我们在涵盖各种场景的12个数据集上广泛评估了MC-TI,结果表明MC-TI在分类和生成结果方面均取得了优越的性能。
引用
@article{arxiv.2410.22317,
title = {Multi-Class Textual-Inversion Secretly Yields a Semantic-Agnostic Classifier},
author = {Kai Wang and Fei Yang and Bogdan Raducanu and Joost van de Weijer},
journal= {arXiv preprint arXiv:2410.22317},
year = {2024}
}
备注
Accepted in WACV 2025. Code link: https://github.com/wangkai930418/mc_ti