基于f散度的后验差分正则化以提升模型鲁棒性
计算与语言
2021-04-13 v2 机器学习
机器学习
摘要
我们解决通过正则化增强模型鲁棒性的问题。具体而言,我们关注那些对干净输入与含噪输入之间模型后验差异进行正则化的方法。理论上,我们在此框架下建立了两种近期方法——雅可比正则化(Jacobian Regularization)与虚拟对抗训练(Virtual Adversarial Training)——之间的联系。此外,我们将后验差分正则化推广至-散度族,并用雅可比矩阵刻画整体正则化框架。在实验上,我们在多样化任务上系统比较了这些正则化方法与标准BERT训练,以提供其对模型域内与域外泛化影响的全面刻画。在完全监督与半监督设定下,我们的实验表明,用-散度正则化后验差分可显著改善模型鲁棒性。特别地,采用恰当的-散度,一个BERT-base模型可在域内、对抗与域偏移场景下取得与其BERT-large对应模型相当的泛化能力,表明所提框架对提升NLP模型泛化的巨大潜力。
引用
@article{arxiv.2010.12638,
title = {Posterior Differential Regularization with f-divergence for Improving Model Robustness},
author = {Hao Cheng and Xiaodong Liu and Lis Pereira and Yaoliang Yu and Jianfeng Gao},
journal= {arXiv preprint arXiv:2010.12638},
year = {2021}
}
备注
NAACL 2021