中文

预训练 Transformer 并非总能提升鲁棒性

计算与语言 2022-10-17 v1 计算机视觉与模式识别

摘要

相较于传统模型,如由 Word2Vec 和 Glove 词嵌入驱动的词袋(BOW)、LSTM、卷积神经网络(CNN),预训练 Transformer(PT)已被证明能改善分布外(OOD)鲁棒性。在数据集的某部分可能存在噪声的真实世界设定下,这种鲁棒性比较是否成立?暴露于噪声数据时,PT 是否也比传统模型提供更鲁棒的表示?我们对 10 种模型进行了比较研究,并发现了经验证据:暴露于噪声数据时,PT 提供的表示比传统模型更不鲁棒。我们进一步探究,并为 PT 增补了一种已被证明能改善 OOD 泛化的对抗过滤(AF)机制。然而,泛化能力的提升未必增加鲁棒性,因为我们发现噪声数据会欺骗由 PT 驱动的 AF 方法。

关键词

引用

@article{arxiv.2210.07663,
  title  = {Pretrained Transformers Do not Always Improve Robustness},
  author = {Swaroop Mishra and Bhavdeep Singh Sachdeva and Chitta Baral},
  journal= {arXiv preprint arXiv:2210.07663},
  year   = {2022}
}