中文

深度视觉识别模型微调的多方面分析

计算机视觉与模式识别 2023-03-29 v1

摘要

近年来,卷积神经网络(CNNs)在各种视觉识别场景中取得了令人印象深刻的性能。在大型标注数据集上训练的 CNNs 不仅能在最具挑战性的基准上获得显著性能,还能提供强大的表征,可用于广泛的其他任务。然而,训练深度神经网络需要海量数据是该模型的主要缺点,因为可用数据通常有限或不平衡。微调(FT)是将源数据集中学到的知识迁移到目标任务的有效方法。本文引入并系统研究了影响视觉识别微调性能的若干因素。这些因素包括重训练过程的参数(如微调的初始学习率)、源数据与目标数据的分布(如源数据集的类别数、源与目标数据集间的距离)等。我们对这些因素进行定量与定性分析,评估其影响,并给出许多经验观察。结果揭示了微调如何改变 CNN 参数的内在机理,并为如何实施计算机视觉任务的微调提供了有用且基于证据的直觉。

关键词

引用

@article{arxiv.1907.05099,
  title  = {Multifaceted Analysis of Fine-Tuning in Deep Model for Visual Recognition},
  author = {Xiangyang Li and Luis Herranz and Shuqiang Jiang},
  journal= {arXiv preprint arXiv:1907.05099},
  year   = {2023}
}

备注

Accepted by ACM Transactions on Data Science