中文

强化数据,倍增影响:通过数据集强化提升模型精度与鲁棒性

计算机视觉与模式识别 2023-09-25 v3 人工智能 机器学习

摘要

我们提出数据集强化(Dataset Reinforcement),一种一次性改进数据集的策略,使得在任何基于强化数据集训练的模型架构上,用户无需额外训练成本即可提升精度。我们提出基于数据增强与知识蒸馏的数据集强化策略。我们的通用策略基于对 CNN 与基于 transformer 的模型的大量分析,以及对采用最先进模型与各种数据增强的蒸馏大规模研究而设计。我们创建了 ImageNet 训练集的强化版本 ImageNet+,以及强化数据集 CIFAR-100+、Flowers-102+ 与 Food-101+。使用 ImageNet+ 训练的模型更精确、鲁棒且校准良好,并能很好地迁移至下游任务(如分割与检测)。例如,ResNet-50 在 ImageNet 验证集上精度提升 1.7%,在 ImageNetV2 上提升 3.5%,在 ImageNet-R 上提升 10.0%。ImageNet 验证集上的期望校准误差(ECE)也降低了 9.9%。将该骨干网络用于 MS-COCO 上基于 Mask-RCNN 的目标检测,平均精度均值提升 0.8%。我们在 MobileNets、ViTs 与 Swin-Transformers 上获得类似增益。对于 MobileNetV3 与 Swin-Tiny,我们观察到在 ImageNet-R/A/C 上高达 20% 的鲁棒性显著提升。在 ImageNet+ 上预训练并在 CIFAR-100+、Flowers-102+ 与 Food-101+ 上微调的模型,精度提升高达 3.4%。代码、数据集与预训练模型可在 https://github.com/apple/ml-dr 获取。

关键词

引用

@article{arxiv.2303.08983,
  title  = {Reinforce Data, Multiply Impact: Improved Model Accuracy and Robustness with Dataset Reinforcement},
  author = {Fartash Faghri and Hadi Pouransari and Sachin Mehta and Mehrdad Farajtabar and Ali Farhadi and Mohammad Rastegari and Oncel Tuzel},
  journal= {arXiv preprint arXiv:2303.08983},
  year   = {2023}
}

备注

Accepted at International Conference on Computer Vision (ICCV) 2023. v2: Camera-ready version with new Tables 9 and 10. v3: Correction to Table 7-Avg. column