样本高效的自然语言处理模型是否更鲁棒?
计算与语言
2023-06-01 v2 机器学习
摘要
近期在图像分类与抽取式问答上的结果观察到,在较少分布内数据上训练的预训练模型具有更好的分布外性能。然而,这些趋势的普适性尚不清楚。我们跨三项任务、三种广泛适用的建模范式干预(增大模型规模、使用不同适配方法、在更多数据上预训练)以及 14 个多样数据集开展大型实证研究,以探究样本效率(达到给定 ID 精度所需数据量)与鲁棒性(模型在 OOD 评估上的表现)间的关系。我们发现,更高的样本效率仅在某些建模干预与任务上同更好的平均 OOD 鲁棒性相关,而非全部。在单个数据集上,样本效率更低的模型甚至可能更鲁棒。这些结果表明,提升样本效率的通用方法不太可能带来普遍的 OOD 鲁棒性改进,因为此类改进高度依赖于数据集与任务。即便在大型、多用途预训练模型时代,针对特定任务的决策对于 OOD 泛化常常仍是必要的。
引用
@article{arxiv.2210.06456,
title = {Are Sample-Efficient NLP Models More Robust?},
author = {Nelson F. Liu and Ananya Kumar and Percy Liang and Robin Jia},
journal= {arXiv preprint arXiv:2210.06456},
year = {2023}
}
备注
18 pages, 14 figures; to appear at ACL 2023