中文

孟子:面向轻量而精巧的中文预训练模型

计算与语言 2021-10-15 v2 人工智能

摘要

尽管预训练模型(PLMs)在广泛的 NLP 任务中取得了显著改进,但其在时间和资源方面代价高昂。这促使人们研究以更少计算量训练更高效但仍具出色性能的模型。我们并不追求更大规模,而是致力于开发以相等或更少计算量训练、轻量且更强大、并便于快速部署的模型。本技术报告发布了我们称为“孟子(Mengzi)”的预训练模型,它代表一系列判别式、生成式、领域特定及多模态的预训练模型变体,能够胜任广泛的语言与视觉任务。与公开的中文 PLM 相比,孟子简洁却更强大。借助我们优化的预训练与微调技术,我们的轻量模型在广泛使用的 CLUE 基准上取得了新的 SOTA 结果。在不修改模型架构的情况下,我们的模型可轻松作为现有 PLM 的替代方案。我们的源码发布于 https://github.com/Langboat/Mengzi。

关键词

引用

@article{arxiv.2110.06696,
  title  = {Mengzi: Towards Lightweight yet Ingenious Pre-trained Models for Chinese},
  author = {Zhuosheng Zhang and Hanqing Zhang and Keming Chen and Yuhang Guo and Jingyun Hua and Yulong Wang and Ming Zhou},
  journal= {arXiv preprint arXiv:2110.06696},
  year   = {2021}
}