扩散如何影响预训练语言模型在分布外数据上的表现?
计算与语言
2023-07-27 v1 人工智能
摘要
基于 Transformer 的预训练语言模型(PLMs)在现代 NLP 中取得了巨大成功。PLMs 的一个重要优势是良好的分布外(OOD)鲁棒性。近来,扩散模型吸引了大量工作将扩散应用于 PLMs。扩散如何影响 PLMs 在 OOD 数据上的表现仍未被充分探索。扩散模型的核心是一个逐步对输入施加高斯噪声的前向扩散过程,以及一个去除噪声的反向去噪过程。噪声输入重建是扩散模型的基本能力。我们通过测量重建损失直接分析 OOD 鲁棒性,包括测试重建 OOD 数据的能力,以及检测 OOD 样本的能力。实验通过分析八个数据集上不同的训练参数和数据统计特征进行。结果表明,用扩散微调 PLMs 会降低其在 OOD 数据上的重建能力。比较还显示扩散模型能有效检测 OOD 样本,在大多数数据集上达到 SOTA 性能,绝对准确率提升高达 18%。这些结果表明扩散降低了 PLMs 的 OOD 鲁棒性。
引用
@article{arxiv.2307.13949,
title = {How Does Diffusion Influence Pretrained Language Models on Out-of-Distribution Data?},
author = {Huazheng Wang and Daixuan Cheng and Haifeng Sun and Jingyu Wang and Qi Qi and Jianxin Liao and Jing Wang and Cong Liu},
journal= {arXiv preprint arXiv:2307.13949},
year = {2023}
}
备注
Accepted by ECAI 2023