训练一次forall网络时是否存在干扰?
机器学习
2022-04-21 v1 计算机视觉与模式识别
摘要
一次forall(OFA)方法利用超网-子网络架构,为将训练好的神经网络模型部署到多个目标平台提供了极佳途径。一旦训练完成,即可从超网(包括架构与训练权重)中导出子网络,并几乎无需重新训练或微调即可直接部署到目标平台。为训练子网络群体,OFA使用了一种称为渐进收缩(PS)的新型训练方法,其设计旨在限制训练期间干扰的负面影响。人们认为训练期间较高的干扰会导致较低的子网络群体精度。在本工作中,我们重新审视了这一干扰效应。令人惊讶的是,我们发现干扰缓解策略对整体子网络群体性能并无重大影响。相反,我们发现训练期间的子网络架构选择偏差是更重要的方面。为说明这一点,我们提出了一种简单而有效的方法,称为随机子网络采样(RSS),其并未对干扰效应进行缓解。尽管没有缓解,RSS在四个中小规模数据集上能够产生比PS性能更优的子网络群体;这表明在这些数据集中干扰效应并未起关键作用。由于其简洁性,RSS相比PS在训练时间上实现了的缩减。当减少RSS训练轮数时,还可在性能合理下降的情况下实现的缩减。代码见 https://github.com/Jordan-HS/RSS-Interference-CVPRW2022。
引用
@article{arxiv.2204.09210,
title = {Does Interference Exist When Training a Once-For-All Network?},
author = {Jordan Shipard and Arnold Wiliem and Clinton Fookes},
journal= {arXiv preprint arXiv:2204.09210},
year = {2022}
}
备注
Accepted to CVPR Embedded Vision Workshop 2022