SEGA:基于语义引导视觉原型注意力的少样本学习
计算机视觉与模式识别
2021-11-09 v1
摘要
由于数据缺乏导致对新类别理解不全面,教机器基于少量训练样本(尤其仅一个样本)识别新类别仍然具有挑战性。然而,人类即使只给出少量样本也能快速学习新类,因为人类可以基于视觉和语义先验知识判断每个类别应关注哪些判别性特征。为了更好地利用这些先验知识,我们提出了语义引导注意力(SEGA)机制,其中语义知识以自上而下的方式引导视觉感知,即在区分某类别与其他类别时应注意哪些视觉特征。因此,即使只有少量样本,新类的嵌入也能更具判别性。具体而言,训练一个特征提取器,借助从基类迁移的视觉先验知识,将每个新类的少量图像嵌入为视觉原型。然后我们学习一个网络,将语义知识映射为类别特定的注意力向量,用于执行特征选择以增强视觉原型。在 miniImageNet、tieredImageNet、CIFAR-FS 和 CUB 上的大量实验表明,我们的语义引导注意力实现了预期功能,并优于当前最优结果。
引用
@article{arxiv.2111.04316,
title = {SEGA: Semantic Guided Attention on Visual Prototype for Few-Shot Learning},
author = {Fengyuan Yang and Ruiping Wang and Xilin Chen},
journal= {arXiv preprint arXiv:2111.04316},
year = {2021}
}
备注
11 pages, 7 figures, 4 tables. Accepted by WACV2022