中文

CLUE:一个中文语言理解评测基准

计算与语言 2020-11-06 v3 机器学习

摘要

诸如 GLUE 和 SuperGLUE 等英文自然语言理解(NLU)基准的出现,使得新的 NLU 模型能够在多样化任务上进行评测。这些综合性基准促进了自然语言处理(NLP)中广泛的研究与应用。然而,问题在于大多数此类基准仅限于英文,这使得难以在其他语言中复现英文 NLU 的诸多成功。为帮助弥补这一问题,我们引入了首个大规模中文语言理解评测(CLUE)基准。CLUE 是一个开放、社区驱动的项目,汇集了 9 项任务,涵盖若干成熟的单句/句对分类任务以及机器阅读理解,均基于原始中文文本。为在这些任务上确立结果,我们使用一组详尽的当前最先进预训练中文模型(共 9 个)报告了分数。我们还引入了一些补充数据集和附加工具,以帮助促进中文 NLU 的进一步进展。我们的基准发布于 https://www.CLUEbenchmarks.com

关键词

引用

@article{arxiv.2004.05986,
  title  = {CLUE: A Chinese Language Understanding Evaluation Benchmark},
  author = {Liang Xu and Hai Hu and Xuanwei Zhang and Lu Li and Chenjie Cao and Yudong Li and Yechen Xu and Kai Sun and Dian Yu and Cong Yu and Yin Tian and Qianqian Dong and Weitang Liu and Bo Shi and Yiming Cui and Junyi Li and Jun Zeng and Rongzhao Wang and Weijian Xie and Yanting Li and Yina Patterson and Zuoyu Tian and Yiwen Zhang and He Zhou and Shaoweihua Liu and Zhe Zhao and Qipeng Zhao and Cong Yue and Xinrui Zhang and Zhengliang Yang and Kyle Richardson and Zhenzhong Lan},
  journal= {arXiv preprint arXiv:2004.05986},
  year   = {2020}
}

备注

Accepted by COLING2020; 10 pages, 4 figures