中文

模型乐高:像拆装积木一样创建模型

计算机视觉与模式识别 2024-11-01 v2

摘要

随着深度学习的快速发展,模型复杂度和参数规模日益增长,使得训练新模型所需的资源越来越多。本文从经典卷积神经网络(CNN)出发,探索一种无需训练即可获得新模型的范式。类似于CNN受生物视觉系统感受野启发而诞生,我们从生物视觉系统的信息子系统通路获得灵感,提出模型拆解与组装(MDA)。在模型拆解阶段,我们引入相对贡献概念并提出组件定位技术,从训练好的CNN分类器中提取任务感知组件。在模型组装阶段,我们提出对齐填充策略和参数缩放策略,利用拆解出的任务感知组件构建面向特定任务的新模型。整个过程类似于玩乐高积木,可实现新模型的任意组装,为模型创建与复用提供了新视角。大量实验表明,从CNN分类器拆解出的任务感知组件或使用这些组件组装的新模型,性能紧密匹配甚至超越基线,展示了其在模型复用方面的良好前景。此外,MDA展现出多种潜在应用,我们通过全面实验探索了模型决策路径分析、模型压缩、知识蒸馏等。代码见 https://github.com/jiaconghu/Model-LEGO。

关键词

引用

@article{arxiv.2203.13453,
  title  = {Model LEGO: Creating Models Like Disassembling and Assembling Building Blocks},
  author = {Jiacong Hu and Jing Gao and Jingwen Ye and Yang Gao and Xingen Wang and Zunlei Feng and Mingli Song},
  journal= {arXiv preprint arXiv:2203.13453},
  year   = {2024}
}