少样本学习能否使用更少的标签?
计算机视觉与模式识别
2020-12-11 v1 机器学习
摘要
少样本学习因其极有限的数据与标签而具挑战性。大迁移(BiT)的近期研究表明,在不同领域的大规模标注数据集上预训练可极大裨益少样本学习。本文提出一个更具挑战性的问题:“我们能否在预训练(无标签)与微调(更少标签)中都尽可能少地使用标签来进行少样本学习?”。我们的核心见解是,目标样本在特征空间中的聚类正是少样本微调所需的全部。这解释了为何朴素无监督预训练(聚类较差)劣于有监督预训练。本文中,我们提出转导式无监督预训练,通过引入数量极有限的目标数据来实现更好的聚类。改善后的聚类结果对于识别最具代表性的样本(“本征样本”)供用户标注极具价值,而反过来,使用标注本征样本继续微调可进一步改进聚类。因此,我们提出本征微调(eigen-finetuning),利用微调中聚类与本征样本的协同演化来实现更少样本学习。我们在 10 个不同少样本目标数据集上实验,平均少样本性能大幅优于朴素归纳式无监督迁移与有监督迁移。例如,当每目标类别仅有 10 个标注样本时,相较上述两基线的平均准确率提升分别为 9.2% 与 3.42%。
引用
@article{arxiv.2012.05899,
title = {Are Fewer Labels Possible for Few-shot Learning?},
author = {Suichan Li and Dongdong Chen and Yinpeng Chen and Lu Yuan and Lei Zhang and Qi Chu and Nenghai Yu},
journal= {arXiv preprint arXiv:2012.05899},
year = {2020}
}