中文

从稳定性视角看使用核心集进行CNN与Transformer的数据高效训练

计算机视觉与模式识别 2023-03-13 v2 机器学习

摘要

核心集选择是减少CNN训练时间最有效的方式之一,然而关于所得模型在核心集大小、数据集与模型选择变化下将如何表现,仅知之甚少。此外,鉴于近期向基于transformer模型的范式转变,核心集选择将如何影响其性能仍是一个开放问题。为使核心集选择方法被广泛接受,有几个类似的引人关注的问题需要回答,本文试图回答其中部分问题。我们提出系统的基准测试设置,并对CNN与transformer上不同核心集选择方法进行严格比较。我们的研究揭示,在某些情况下,与SOTA选择方法相比,随机子集选择更为鲁棒与稳定。我们证明,跨数据各类别均匀子集采样的传统概念并非恰当选择。样本应基于每类数据分布的复杂度自适应选取。Transformer通常在大型数据集上预训练,我们展示对于某些目标数据集,这有助于使其在极小核心集大小下性能保持稳定。我们进一步展示,当未进行预训练或将预训练transformer模型用于非自然图像(如医疗数据)时,CNN即使在极小核心集大小下也往往比transformer泛化更好。最后,我们证明在缺乏恰当预训练时,CNN更善于学习图像内空间遥远对象间的语义一致性,且其几乎在所有核心集大小选择下都优于transformer。

关键词

引用

@article{arxiv.2303.02095,
  title  = {Data-Efficient Training of CNNs and Transformers with Coresets: A Stability Perspective},
  author = {Animesh Gupta and Irtiza Hasan and Dilip K. Prasad and Deepak K. Gupta},
  journal= {arXiv preprint arXiv:2303.02095},
  year   = {2023}
}