中文

TFormer:一种面向物联网设备的传输友好型 ViT 模型

计算机视觉与模式识别 2023-02-16 v1 分布式、并行与集群计算 机器学习

摘要

在 ubiquitous 的物联网(IoT)设备上部署高性能视觉 transformer(ViT)模型以提供高质量视觉服务,将彻底改变我们生活、工作及与世界交互的方式。由于 IoT 设备资源有限与资源密集型 ViT 模型之间的矛盾,利用云服务器辅助 ViT 模型训练已成为主流。然而,由于现有 ViT 模型参数量和浮点运算次数(FLOPs)较大,云服务器传输的模型参数庞大且难以在资源受限的 IoT 设备上运行。为此,本文提出一种传输友好的 ViT 模型 TFormer,用于在云服务器辅助下部署于资源受限的 IoT 设备。TFormer 的高性能及少量模型参数与 FLOPs 归功于所提出的混合层与所提出的部分连接前馈网络(PCS-FFN)。混合层由不可学习模块与逐点卷积组成,能以极少参数和 FLOPs 获取多类型、多尺度特征,从而提升 TFormer 性能。PCS-FFN 采用分组卷积以减少参数量。本文核心思想是提出参数与 FLOPs 均少的 TFormer,以促使运行于资源受限 IoT 设备上的应用受益于 ViT 模型的高性能。在 ImageNet-1K、MS COCO 与 ADE20K 数据集上针对图像分类、目标检测与语义分割任务的实验结果表明,所提模型优于其他 state-of-the-art 模型。具体而言,TFormer-S 在 ImageNet-1K 上比 ResNet18 准确率高出 5%,而参数与 FLOPs 仅为其 1/1.4(少 1.4×\times)。

关键词

引用

@article{arxiv.2302.07734,
  title  = {TFormer: A Transmission-Friendly ViT Model for IoT Devices},
  author = {Zhichao Lu and Chuntao Ding and Felix Juefei-Xu and Vishnu Naresh Boddeti and Shangguang Wang and Yun Yang},
  journal= {arXiv preprint arXiv:2302.07734},
  year   = {2023}
}

备注

IEEE Transactions on Parallel and Distributed Systems