中文

重新思考少样本分类中的泛化性

计算机视觉与模式识别 2022-10-18 v3

摘要

单图像级标注仅能正确描述图像内容中往往较小的一个子集,尤其在刻画复杂真实场景时。尽管这在许多分类场景中可以接受,但对于训练与测试时类别集合差异显著的的应用而言,这构成了重大挑战。本文中,我们仔细考察其在 少样本学习\textit{少样本学习} 背景下的影响。将输入样本切分为块并借助 Vision Transformers 编码,使我们能跨图像建立局部区域间独立于各自类别的语义对应。随后,针对当前任务最具信息量的块嵌入被确定为支持集的函数,通过推理时的在线优化得出,并额外提供图像中“最关键内容\textit{最关键内容}”的可视化解释性。我们基于近期通过掩码图像建模的无监督网络训练进展,以克服细粒度标签的缺失并学习数据更一般的统计结构,同时避免负向图像级标注影响,即 aka\textit{aka} 监督崩塌。实验结果表明了我们方法的竞争力,在四个流行的少样本分类基准的 55-shot 与 11-shot 场景中取得了新的 SOTA 结果。

关键词

引用

@article{arxiv.2206.07267,
  title  = {Rethinking Generalization in Few-Shot Classification},
  author = {Markus Hiller and Rongkai Ma and Mehrtash Harandi and Tom Drummond},
  journal= {arXiv preprint arXiv:2206.07267},
  year   = {2022}
}

备注

Accepted at NeurIPS 2022. Code available at https://github.com/mrkshllr/FewTURE