中文

组知识迁移:边缘设备上大型 CNN 的联邦学习

机器学习 2020-11-06 v4 计算机视觉与模式识别

摘要

扩大卷积神经网络(CNN)的规模(例如宽度、深度等)已知可有效提升模型精度。然而,庞大的模型尺寸阻碍了在资源受限的边缘设备上进行训练。例如,联邦学习(FL)可能会给边缘节点的计算能力带来过重负担,尽管由于其隐私和保密特性,对 FL 存在强烈的实际需求。为应对边缘设备资源受限的现实,我们将 FL 重新表述为一种称为 FedGKT 的组知识迁移训练算法。FedGKT 设计了一种交替最小化方法的变体,在边缘节点上训练小型 CNN,并定期通过知识蒸馏将其知识迁移到一个大型服务器端 CNN。FedGKT 将多项优势整合到单一框架中:降低边缘计算需求、减少大型 CNN 的通信带宽以及异步训练,同时保持与 FedAvg 相当的模型精度。我们使用基于 ResNet-56 和 ResNet-110 设计的 CNN,在三个不同数据集(CIFAR-10、CIFAR-100 和 CINIC-10)及其非独立同分布变体上进行了训练。我们的结果表明,FedGKT 可以取得与 FedAvg 相当甚至略高的精度。更重要的是,FedGKT 使边缘训练变得可行。与使用 FedAvg 的边缘训练相比,FedGKT 在边缘设备上所需的计算能力(FLOPs)减少 9 至 17 倍,且边缘 CNN 的参数减少 54 至 105 倍。我们的源代码发布于 FedML(https://fedml.ai)。

关键词

引用

@article{arxiv.2007.14513,
  title  = {Group Knowledge Transfer: Federated Learning of Large CNNs at the Edge},
  author = {Chaoyang He and Murali Annavaram and Salman Avestimehr},
  journal= {arXiv preprint arXiv:2007.14513},
  year   = {2020}
}

备注

This paper is accepted to NeurIPS 2020. We propose FedGKT, attempting to address one of the core problems of federated learning: training deep neural networks in resource-constrained edge devices