重访 NLP 中的分布外鲁棒性:基准、分析与 LLM 评估
计算与语言
2023-10-27 v2 密码学与安全
机器学习
摘要
本文重新审视自然语言处理(NLP)领域中关于分布外(OOD)鲁棒性的研究。我们发现以往研究中的分布偏移设定普遍缺乏足够挑战性,阻碍了 OOD 鲁棒性的准确评估。为解决这些问题,我们提出一种确保清晰区分与挑战性分布偏移的基准构建协议。随后我们引入 BOSS,一个覆盖 5 项任务和 20 个数据集的分布外鲁棒性评估基准套件(Benchmark suite for Out-of-distribution robustneSS)。基于 BOSS,我们对预训练语言模型进行了一系列实验以分析和评估 OOD 鲁棒性。首先,对于普通微调,我们考察了分布内(ID)与 OOD 性能之间的关系。我们识别出三种典型类型,揭示了内在学习机制,可能有助于预测 OOD 鲁棒性,并与 ID 数据集上的进展相关联。接着,我们在 BOSS 上评估了 5 种经典方法,发现尽管在特定情形下展现出一定有效性,它们相较普通微调并未提供显著改进。进一步,我们以多种适配范式评估了 5 个 LLM,发现当充足的 ID 数据可用时,微调领域特定模型在 ID 样本上显著优于 LLM。然而在 OOD 实例情况下,优先采用具有上下文学习能力的 LLM 可取得更好结果。我们确认微调小模型与 LLM 均面临有效处理下游任务的挑战。代码已公开于 \url{https://github.com/lifan-yuan/OOD_NLP}。
引用
@article{arxiv.2306.04618,
title = {Revisiting Out-of-distribution Robustness in NLP: Benchmark, Analysis, and LLMs Evaluations},
author = {Lifan Yuan and Yangyi Chen and Ganqu Cui and Hongcheng Gao and Fangyuan Zou and Xingyi Cheng and Heng Ji and Zhiyuan Liu and Maosong Sun},
journal= {arXiv preprint arXiv:2306.04618},
year = {2023}
}
备注
Accepted to NeurIPS 2023 Dataset and Benchmark Track. Code is available at \url{https://github.com/lifan-yuan/OOD_NLP}