中文

ElitePLM:预训练语言模型通用语言能力评估的实证研究

计算与语言 2022-05-04 v1

摘要

如今,预训练语言模型(PLMs)已主导了绝大多数 NLP 任务。然而,关于系统评估 PLM 语言能力的深入研究甚少。本文提出一项关于 PLM 通用语言能力评估的大规模实证研究(ElitePLM)。在研究中,我们设计了记忆、理解、推理与组合四个评估维度,对五类共十个广泛使用的 PLM 进行测评。我们的实证结果表明:(1) 具有不同训练目标与策略的 PLM 在不同能力测试中各有擅长;(2) 在下游任务中对 PLM 进行微调通常对数据规模与分布敏感;(3) PLM 在相似任务间具有优异的可迁移性。此外,我们将实验中 PLM 的预测结果作为开放资源发布,以便对 PLM 语言能力进行更深入细致的分析。本文可指导未来针对特定任务选择、应用与设计 PLM 的工作。我们已在 https://github.com/RUCAIBox/ElitePLM 公开全部实验细节。

关键词

引用

@article{arxiv.2205.01523,
  title  = {ElitePLM: An Empirical Study on General Language Ability Evaluation of Pretrained Language Models},
  author = {Junyi Li and Tianyi Tang and Zheng Gong and Lixin Yang and Zhuohao Yu and Zhipeng Chen and Jingyuan Wang and Wayne Xin Zhao and Ji-Rong Wen},
  journal= {arXiv preprint arXiv:2205.01523},
  year   = {2022}
}

备注

Accepted by NAACL 2022 main conference (Long Paper)