预训练 Transformer 并非总能提升鲁棒性
计算与语言
2022-10-17 v1 计算机视觉与模式识别
摘要
相较于传统模型,如由 Word2Vec 和 Glove 词嵌入驱动的词袋(BOW)、LSTM、卷积神经网络(CNN),预训练 Transformer(PT)已被证明能改善分布外(OOD)鲁棒性。在数据集的某部分可能存在噪声的真实世界设定下,这种鲁棒性比较是否成立?暴露于噪声数据时,PT 是否也比传统模型提供更鲁棒的表示?我们对 10 种模型进行了比较研究,并发现了经验证据:暴露于噪声数据时,PT 提供的表示比传统模型更不鲁棒。我们进一步探究,并为 PT 增补了一种已被证明能改善 OOD 泛化的对抗过滤(AF)机制。然而,泛化能力的提升未必增加鲁棒性,因为我们发现噪声数据会欺骗由 PT 驱动的 AF 方法。
引用
@article{arxiv.2210.07663,
title = {Pretrained Transformers Do not Always Improve Robustness},
author = {Swaroop Mishra and Bhavdeep Singh Sachdeva and Chitta Baral},
journal= {arXiv preprint arXiv:2210.07663},
year = {2022}
}