FewNLU:基准测试少样本自然语言理解的最新方法
计算与语言
2022-03-16 v2 机器学习
摘要
少样本自然语言理解(NLU)任务近来备受关注。然而,先前的方法是在一套不一致的协议下进行评估的,这阻碍了公平比较和衡量该领域的进展。为解决此问题,我们引入了一个评估框架,该框架在三个关键方面改进了先前的评估程序,即测试性能、开发-测试相关性以及稳定性。在此新评估框架下,我们重新评估了若干用于 NLU 任务的最新少样本方法。我们的框架揭示了新的见解:(1)先前文献中未准确估计这些方法的绝对性能和相对差距;(2)没有单一方法能以一致的性能在大多数任务中占据主导地位;(3)某些方法的改进会随着预训练模型的增大而减弱;(4)不同方法的增益通常是互补的,且最佳组合模型的性能接近强大的全监督基线。我们开源了工具包 FewNLU,它实现了我们的评估框架以及多种最新方法。
引用
@article{arxiv.2109.12742,
title = {FewNLU: Benchmarking State-of-the-Art Methods for Few-Shot Natural Language Understanding},
author = {Yanan Zheng and Jing Zhou and Yujie Qian and Ming Ding and Chonghua Liao and Jian Li and Ruslan Salakhutdinov and Jie Tang and Sebastian Ruder and Zhilin Yang},
journal= {arXiv preprint arXiv:2109.12742},
year = {2022}
}