中文

我们能否通过难样本学得更好?

计算机视觉与模式识别 2023-04-10 v1 人工智能

摘要

在深度学习中,小批量训练常用于优化网络参数。然而,传统小批量方法可能学不到数据中代表性不足的样本与复杂模式,导致泛化时间更长。为解决该问题,提出了一种传统算法的变体,其聚焦于高损失的小批量来训练网络。该研究使用在三个基准数据集(CIFAR-10、CIFAR-100 和 STL-10)上训练的各种深度神经网络评估了所提训练的有效性。研究中使用的深度神经网络为 ResNet-18、ResNet-50、Efficient Net B4、EfficientNetV2-S 和 MobilenetV3-S。实验结果表明,与传统小批量训练方法相比,所提方法能显著提升测试精度并加速收敛。此外,我们引入了一个超参数 delta (δ{\delta}) 来决定参与训练的小批量数量。对不同 δ{\delta} 值的实验发现,所提方法在较小 δ{\delta} 值下的性能通常带来相似的测试精度与更快的泛化。我们表明,在 STL-10 上 EfficientNet-B4 中,所提方法比传统小批量方法少 26.47% 的轮数即可泛化。所提方法在 CIFAR-100 上的 ResNet-18 还将测试 top-1 精度提升了 7.26%。

关键词

引用

@article{arxiv.2304.03486,
  title  = {Can we learn better with hard samples?},
  author = {Subin Sahayam and John Zakkam and Umarani Jayaraman},
  journal= {arXiv preprint arXiv:2304.03486},
  year   = {2023}
}