面向零样本属性分类的超类引导 Transformer
计算机视觉与模式识别
2025-01-17 v2
摘要
属性分类对于识别图像区域的特定特征至关重要。视觉-语言模型(VLM)通过利用大规模数据集中的通用知识,在零样本任务中取得了良好效果。近期研究表明,基于Transformer且采用类别查询的模型可有效解决零样本多标签分类问题。然而,未充分利用已见属性与未见属性之间的关系,导致模型缺乏普遍性。此外,属性分类通常涉及大量属性,难以维持模型的可扩展性。为此,我们提出超类引导 transFormer(SugaFormer),一种新型框架,利用超类增强零样本属性分类的可扩展性和普遍性。SugaFormer采用超类查询初始化(SQI)以减少查询数量,利用超类的共同语义信息,并纳入多上下文解码(MD)以处理多样化的视觉线索。为强化普遍性,我们引入两种知识迁移策略,利用VLM。在训练期间,超类引导一致性正则化(SCR)利用超类引导的提示词将模型特征与VLM对齐;在推理期间,基于零样本检索的得分增强(ZRSE)细化未见属性的预测。广泛实验表明,SugaFormer在三个广泛使用的属性分类基准测试的零样本和跨数据集迁移设置下实现了最先进的性能。我们的代码已公开于 https://github.com/mlvlab/SugaFormer。
引用
@article{arxiv.2501.05728,
title = {Super-class guided Transformer for Zero-Shot Attribute Classification},
author = {Sehyung Kim and Chanhyeong Yang and Jihwan Park and Taehoon Song and Hyunwoo J. Kim},
journal= {arXiv preprint arXiv:2501.05728},
year = {2025}
}
备注
AAAI25