CAMERO:基于权重共享的扰动语言模型一致性正则化集成方法
计算与语言
2022-04-19 v2 机器学习
摘要
模型集成是一种产生低方差且泛化能力良好模型的常用方法。然而,它会带来较大的内存和推理成本,在实际部署中往往难以承受。现有工作尝试在模型间共享权重。但当共享权重比例增加时,所得模型趋于相似,模型集成的优势随之减弱。为在保持低内存成本的同时保留集成优势,我们提出一种基于扰动模型的一致性正则化集成学习方法,名为 CAMERO。具体而言,我们在所有模型间共享底层权重,并对不同模型施加不同的隐藏表示扰动,从而有效提升模型多样性。同时,我们在扰动模型间施加预测一致性正则项以控制由模型多样性引起的方差。我们使用大语言模型(large language models, LLM)的实验表明,CAMERO 显著提升了集成模型的泛化性能。具体而言,在 GLUE 基准上,CAMERO 以显著更小的模型规模(114.2M 对比 880.6M)超越了由 8 个 BERT-base 模型组成的标准集成,提升 0.7。
引用
@article{arxiv.2204.06625,
title = {CAMERO: Consistency Regularized Ensemble of Perturbed Language Models with Weight Sharing},
author = {Chen Liang and Pengcheng He and Yelong Shen and Weizhu Chen and Tuo Zhao},
journal= {arXiv preprint arXiv:2204.06625},
year = {2022}
}
备注
Proceedings of ACL 2022