中文

NetTailor:调整架构而非仅调整权重

计算机视觉与模式识别 2019-07-02 v1 机器学习

摘要

物体识别的实际应用通常需要在单一平台上解决多个任务。在标准网络微调范式下,每个任务都要学习一个全新的 CNN,且最终网络规模与任务复杂度无关。这种做法浪费资源,因为简单任务比复杂任务需要更小的网络,并且限制了可同时解决的任务数量。为解决这些问题,我们提出一种称为 NetTailor 的迁移学习流程,其中预训练 CNN 的层被用作通用模块,可与小型任务特定层组合以生成新网络。除了最小化分类误差外,新网络还被训练以模仿一个强大的无约束 CNN 的内部激活,并通过以下组合最小化其复杂度:1) 模块上的软注意力机制,以及 2) 复杂度正则化约束。以此方式,NetTailor 能够调整网络架构,而不仅仅是其权重,以适应目标任务。实验表明,适配简单任务(如字符或交通标志识别)的网络明显小于适配困难任务(如细粒度识别)的网络。更重要的是,由于该流程的模块化特性,这种网络复杂度的降低是在不牺牲跨任务参数共享或分类精度的前提下实现的。

关键词

引用

@article{arxiv.1907.00274,
  title  = {NetTailor: Tuning the Architecture, Not Just the Weights},
  author = {Pedro Morgado and Nuno Vasconcelos},
  journal= {arXiv preprint arXiv:1907.00274},
  year   = {2019}
}