中文

为何更好的损失函数导致可迁移性更差的特征?

计算机视觉与模式识别 2021-11-05 v2 机器学习

摘要

先前的工作提出了许多新的损失函数与正则化器,提升了图像分类任务的测试准确率。然而,尚不清楚这些损失函数是否为下游任务学习了更好的表征。本文研究在 ImageNet 上训练的卷积神经网络,其训练目标的选择如何影响隐藏表征的可迁移性。我们表明,许多目标相对于原始 softmax 交叉熵在 ImageNet 准确率上带来统计显著的提升,但由此得到的固定特征提取器向下游任务的迁移明显更差,且当网络在新任务上被完全微调时,损失的选择影响甚微。使用中心核对齐来衡量网络隐藏表征之间的相似性,我们发现损失函数间的差异仅出现在网络的最后几层。我们深入探究倒数第二层的表征,发现不同的目标与超参数组合导致截然不同的类分离水平。具有更高类分离的表征在原始任务上获得更高准确率,但其特征对下游任务用处更小。我们的结果表明,为原始任务学习不变特征与为迁移任务学习相关特征之间存在权衡。

关键词

引用

@article{arxiv.2010.16402,
  title  = {Why Do Better Loss Functions Lead to Less Transferable Features?},
  author = {Simon Kornblith and Ting Chen and Honglak Lee and Mohammad Norouzi},
  journal= {arXiv preprint arXiv:2010.16402},
  year   = {2021}
}

备注

NeurIPS 2021