FewCLUE:一个中文少样本学习评测基准
计算与语言
2021-09-30 v2 人工智能
摘要
预训练语言模型(PLMs)在自然语言理解任务中取得了巨大成功。尽管针对英语等语言,微调、零样本和少样本学习等不同学习范式已被广泛探索与比较,但中文领域公平且全面评估与比较这些方法的工作相对较少,从而阻碍了累积性进展。本文介绍了中文少样本学习评测基准(FewCLUE),这是首个全面的中文少样本评测基准。其包含九项任务,涵盖单句与句对分类任务以及机器阅读理解任务。我们在新构建的 FewCLUE 基准上系统评估了五种当前最优(SOTA)少样本学习方法(包括 PET、ADAPET、LM-BFF、P-tuning 和 EFL),并将其性能与微调及零样本学习范式进行比较。实验结果表明:1)不同少样本学习方法的效果对所应用的预训练模型敏感;2)PET 与 P-tuning 分别在 RoBERTa 和 ERNIE 上取得最佳整体性能。我们的基准被用于 NLPCC 2021 的少样本学习竞赛。此外,我们提供了一个用户友好的工具包以及一个在线排行榜,以帮助促进中文少样本学习的进一步进展。我们提供了不同学习方法上的基线性能,作为未来研究的参考。
引用
@article{arxiv.2107.07498,
title = {FewCLUE: A Chinese Few-shot Learning Evaluation Benchmark},
author = {Liang Xu and Xiaojing Lu and Chenyang Yuan and Xuanwei Zhang and Huilin Xu and Hu Yuan and Guoao Wei and Xiang Pan and Xin Tian and Libo Qin and Hu Hai},
journal= {arXiv preprint arXiv:2107.07498},
year = {2021}
}
备注
10 pages, 3 tables