基于词向量引导注意的多标签少样本图像分类原型推断
计算机视觉与模式识别
2021-12-08 v2 计算与语言
摘要
多标签少样本图像分类(ML-FSIC)是基于少量训练样本为未见图像分配描述性标签的任务。多标签设置的一个关键特征是图像通常具有多个标签,且这些标签往往对应图像的不同区域。因此,在基于度量的设定下估计原型时,确定哪些区域与哪些标签相关至关重要,但有限的训练数据使此问题极具挑战。作为解决方案,本文提出使用词嵌入作为关于标签语义的先验知识。具体而言,利用依赖于标签嵌入的注意力机制聚合支持图像的局部特征图来获得视觉原型。作为重要优势,我们的模型无需微调任何模型参数即可推断未见标签的原型,展现出强大的泛化能力。在 COCO 和 PASCAL VOC 上的实验进一步表明,我们的模型大幅改进了当前最优水平。
引用
@article{arxiv.2112.01037,
title = {Inferring Prototypes for Multi-Label Few-Shot Image Classification with Word Vector Guided Attention},
author = {Kun Yan and Chenbin Zhang and Jun Hou and Ping Wang and Zied Bouraoui and Shoaib Jameel and Steven Schockaert},
journal= {arXiv preprint arXiv:2112.01037},
year = {2021}
}
备注
Accepted by AAAI2022