预训练 Transformer 提升分布外鲁棒性
计算与语言
2020-04-17 v2 机器学习
摘要
尽管诸如 BERT 的预训练 Transformer 在分布内样本上取得了高准确率,它们是否能推广到新的分布?我们通过构建具有真实分布偏移的新鲁棒性基准,系统性地度量了七个 NLP 数据集上的分布外(OOD)泛化。我们度量了包括词袋模型、ConvNets 和 LSTMs 在内的先前模型的泛化能力,并展示预训练 Transformer 的性能下降显著更小。预训练 Transformer 在检测异常或 OOD 样本上也更为有效,而许多先前模型常比随机更差。我们考察了影响鲁棒性的因素,发现更大的模型未必更鲁棒、蒸馏可能有害、更多样的预训练数据可增强鲁棒性。最后,我们指出未来工作可改进 OOD 鲁棒性的方向。
引用
@article{arxiv.2004.06100,
title = {Pretrained Transformers Improve Out-of-Distribution Robustness},
author = {Dan Hendrycks and Xiaoyuan Liu and Eric Wallace and Adam Dziedzic and Rishabh Krishnan and Dawn Song},
journal= {arXiv preprint arXiv:2004.06100},
year = {2020}
}
备注
ACL 2020