GLGE:一个新的通用语言生成评测基准
计算与语言
2021-06-02 v3
摘要
GLUE 和 SuperGLUE 等多任务基准推动了自然语言处理(NLP)中预训练和迁移学习的巨大进展。这些基准大多关注一系列自然语言理解(NLU)任务,而未考虑自然语言生成(NLG)模型。在本文中,我们提出通用语言生成评测(GLGE),一个用于评估 NLG 模型在八个语言生成任务上泛化能力的新多任务基准。对于每个任务,我们依据任务难度(GLGE-Easy、GLGE-Medium 和 GLGE-Hard)继续设计三个子任务。这引入了 24 个子任务以全面比较模型性能。为鼓励对 NLG 模型预训练和迁移学习的研究,我们公开了 GLGE 并构建了包含 MASS、BART 和 ProphetNet 等强基线模型的排行榜(源代码和数据集公开于 https://github.com/microsoft/glge)。
引用
@article{arxiv.2011.11928,
title = {GLGE: A New General Language Generation Evaluation Benchmark},
author = {Dayiheng Liu and Yu Yan and Yeyun Gong and Weizhen Qi and Hang Zhang and Jian Jiao and Weizhu Chen and Jie Fu and Linjun Shou and Ming Gong and Pengcheng Wang and Jiusheng Chen and Daxin Jiang and Jiancheng Lv and Ruofei Zhang and Winnie Wu and Ming Zhou and Nan Duan},
journal= {arXiv preprint arXiv:2011.11928},
year = {2021}
}
备注
Findings of Association for Computational Linguistics. ACL 2021