中文

元集成参数学习

计算机视觉与模式识别 2022-10-06 v1 机器学习

摘要

机器学习模型的集成可提升性能与鲁棒性,但其内存需求与推理成本可能高得令人却步。知识蒸馏是一种使单一模型高效逼近集成性能的方法,但在引入新教师模型时需重新训练,可扩展性较差。本文研究能否利用元学习策略直接预测具有可比集成性能的单模型参数。为此,我们提出 WeightFormer,一种基于 Transformer 的模型,可根据教师模型参数在前向传播中逐层预测学生网络权重。在 CIFAR-10、CIFAR-100 与 ImageNet 数据集上,针对 VGGNet-11、ResNet-50 与 ViT-B/32 的模型结构对 WeightFormer 的特性进行了探究,结果表明我们的方法能达到近似集成的分类性能,并优于单一网络与标准知识蒸馏。更令人鼓舞的是,我们展示经轻微微调后 WeightFormer 的结果可进一步超越平均集成。重要的是,我们的任务连同模型与结果有望催生一种更新、更高效且可扩展的集成网络参数学习范式。

关键词

引用

@article{arxiv.2210.01973,
  title  = {Meta-Ensemble Parameter Learning},
  author = {Zhengcong Fei and Shuman Tian and Junshi Huang and Xiaoming Wei and Xiaolin Wei},
  journal= {arXiv preprint arXiv:2210.01973},
  year   = {2022}
}

备注

technique report