基于多模态知识迁移的开放词汇多标签分类
计算机视觉与模式识别
2023-02-02 v2
摘要
现实世界的识别系统常面临未见标签的挑战。为识别此类未见标签,多标签零样本学习(ML-ZSL)侧重于通过预训练的文本标签嵌入(如 GloVe)迁移知识。然而,此类方法仅利用语言模型的单模态知识,忽略了图像-文本对中固有的丰富语义信息。相反,近期发展的开放词汇(OV)方法在目标检测中成功利用了图像-文本对的此类信息,并取得令人印象深刻的性能。受 OV 方法成功的启发,我们提出一种新颖的开放词汇框架,称为多模态知识迁移(MKT),用于多标签分类。具体而言,我们的方法基于视觉与语言预训练(VLP)模型利用图像-文本对的多模态知识。为便于迁移 VLP 模型的图像-文本匹配能力,采用知识蒸馏以保证图像与标签嵌入的一致性,并配合提示微调进一步更新标签嵌入。为进一步实现多目标识别,开发了简单而有效的双流模块以捕获局部与全局特征。大量实验结果表明,我们的方法在公开基准数据集上显著优于最先进的方法。源代码见 https://github.com/sunanhe/MKT。
引用
@article{arxiv.2207.01887,
title = {Open-Vocabulary Multi-Label Classification via Multi-Modal Knowledge Transfer},
author = {Sunan He and Taian Guo and Tao Dai and Ruizhi Qiao and Bo Ren and Shu-Tao Xia},
journal= {arXiv preprint arXiv:2207.01887},
year = {2023}
}
备注
AAAI 2023 (Oral presentation paper). Updated version