DualCoOp:在有限标注下快速适应多标签识别
计算机视觉与模式识别
2022-06-22 v1
摘要
在低标签情形下解决图像的多标签识别(MLR)是一项具有挑战性的任务,并有着许多实际应用。近期的工作通过学习文本和视觉空间之间的对齐来弥补图像标签的不足,但由于可用的 MLR 标注数量有限而损失了准确性。在这项工作中,我们利用通过数百万辅助图像-文本对预训练的文本和视觉特征的强对齐,提出了 Dual Context Optimization(DualCoOp)作为部分标签 MLR 和零样本 MLR 的统一框架。DualCoOp 将带有类别名称的正负上下文编码为语言输入(即提示)的一部分。由于 DualCoOp 仅在预训练的视觉-语言框架上引入了非常轻量的可学习开销,它可以快速适应标注有限甚至包含未见类别的多标签识别任务。在两个具有挑战性的低标签设置下,在标准多标签识别基准上的实验证明了我们的方法相对于最先进方法的优势。
引用
@article{arxiv.2206.09541,
title = {DualCoOp: Fast Adaptation to Multi-Label Recognition with Limited Annotations},
author = {Ximeng Sun and Ping Hu and Kate Saenko},
journal= {arXiv preprint arXiv:2206.09541},
year = {2022}
}