面向预训练标签粒度影响的理解
计算机视觉与模式识别
2023-10-06 v2 机器学习
摘要
在本文中,我们研究预训练标签的粒度如何影响深度神经网络在图像分类任务中的泛化能力。我们关注“细到粗”的迁移学习设定,其中预训练标签空间比目标问题更细粒度。通过实验,我们表明在 ImageNet21k 的叶节点标签上预训练比在其他较粗粒度级别上预训练在 ImageNet1k 上产生更好的迁移结果,这支持了社区中常用的做法。在理论上,我们通过证明对于满足特定层次条件的数据分布,1)粗粒度预训练仅允许神经网络很好地学习“共同”或“易学”特征,而 2)细粒度预训练帮助网络除共同特征外还学习“更稀有”或“细粒度”特征,从而提升其在缺失或弱共同特征难样本上的准确率,来解释细粒度预训练的好处。此外,我们使用 iNaturalist 2021 的标签层次进行全面的实验,并观察到除恰当选择标签粒度外,以下条件使迁移在实践中良好工作:1)预训练数据集需要有意义的标签层次,以及 2)预训练与目标标签函数需要对齐良好。
引用
@article{arxiv.2303.16887,
title = {Towards Understanding the Effect of Pretraining Label Granularity},
author = {Guan Zhe Hong and Yin Cui and Ariel Fuxman and Stanley H. Chan and Enming Luo},
journal= {arXiv preprint arXiv:2303.16887},
year = {2023}
}