基于查询的知识共享用于开放词汇多标签分类
计算机视觉与模式识别
2024-01-03 v1
摘要
识别训练中未出现的标签(称为多标签零样本学习)是计算机视觉中的一项非平凡任务。为此,最近的研究尝试通过知识蒸馏探索视觉-语言预训练(VLP)模型的多模态知识,从而以开放词汇方式识别未见标签。然而,实验证据表明知识蒸馏是次优的,并且在未见标签预测中提供的性能提升有限。本文提出了一种新颖的基于查询的知识共享范式,用于从预训练的VLP模型中探索多模态知识以进行开放词汇多标签分类。具体地,训练一组可学习的与标签无关的查询令牌,从输入图像中提取关键视觉知识,并在所有标签之间共享,使它们能够选择感兴趣的令牌作为视觉线索进行识别。此外,我们提出了一个有效的提示池用于鲁棒的标签嵌入,并将标准排序学习重新表述为分类形式,以允许特征向量的幅度进行匹配,这两者都显著有利于标签识别。实验结果表明,我们的框架在零样本任务上,在NUS-WIDE和Open Images数据集上的mAP分别比最先进方法高出5.9%和4.5%。
引用
@article{arxiv.2401.01181,
title = {Query-Based Knowledge Sharing for Open-Vocabulary Multi-Label Classification},
author = {Xuelin Zhu and Jian Liu and Dongqi Tang and Jiawei Ge and Weijia Liu and Bo Liu and Jiuxin Cao},
journal= {arXiv preprint arXiv:2401.01181},
year = {2024}
}