TResNet:面向 GPU 的高性能专用架构
计算机视觉与模式识别
2020-08-28 v3 机器学习
图像与视频处理
摘要
近年来开发的许多深度学习模型,在 FLOPS 数量更少或相当的情况下,达到了比 ResNet50 更高的 ImageNet 准确率。虽然 FLOPS 常被视为网络效率的代理指标,但在衡量实际 GPU 训练和推理吞吐量时,原始 ResNet50 通常明显快于其近期竞争者,提供了更好的吞吐量-准确率权衡。在这项工作中,我们引入了一系列架构修改,旨在提升神经网络准确率,同时保持其 GPU 训练和推理效率。我们首先展示并讨论了由 FLOPs 优化引起的瓶颈。然后我们提出了能更好利用 GPU 结构和资源的替代设计。最后,我们引入了一系列新的 GPU 专用模型,称为 TResNet,其准确率和效率均优于先前的 ConvNets。使用与 ResNet50 具有相似 GPU 吞吐量的 TResNet 模型,我们在 ImageNet 上达到了 80.8 的 top-1 准确率。我们的 TResNet 模型也具有很好的迁移性,并在具有竞争力的单标签分类数据集上取得了最先进的准确率,如 Stanford cars (96.0%)、CIFAR-10 (99.0%)、CIFAR-100 (91.5%) 和 Oxford-Flowers (99.1%)。它们在多标签分类和目标检测任务上也表现良好。实现代码见:https://github.com/mrT23/TResNet。
引用
@article{arxiv.2003.13630,
title = {TResNet: High Performance GPU-Dedicated Architecture},
author = {Tal Ridnik and Hussam Lawen and Asaf Noy and Emanuel Ben Baruch and Gilad Sharir and Itamar Friedman},
journal= {arXiv preprint arXiv:2003.13630},
year = {2020}
}
备注
11 pages, 5 figures