孟子:面向轻量而精巧的中文预训练模型
计算与语言
2021-10-15 v2 人工智能
摘要
尽管预训练模型(PLMs)在广泛的 NLP 任务中取得了显著改进,但其在时间和资源方面代价高昂。这促使人们研究以更少计算量训练更高效但仍具出色性能的模型。我们并不追求更大规模,而是致力于开发以相等或更少计算量训练、轻量且更强大、并便于快速部署的模型。本技术报告发布了我们称为“孟子(Mengzi)”的预训练模型,它代表一系列判别式、生成式、领域特定及多模态的预训练模型变体,能够胜任广泛的语言与视觉任务。与公开的中文 PLM 相比,孟子简洁却更强大。借助我们优化的预训练与微调技术,我们的轻量模型在广泛使用的 CLUE 基准上取得了新的 SOTA 结果。在不修改模型架构的情况下,我们的模型可轻松作为现有 PLM 的替代方案。我们的源码发布于 https://github.com/Langboat/Mengzi。
引用
@article{arxiv.2110.06696,
title = {Mengzi: Towards Lightweight yet Ingenious Pre-trained Models for Chinese},
author = {Zhuosheng Zhang and Hanqing Zhang and Keming Chen and Yuhang Guo and Jingyun Hua and Yulong Wang and Ming Zhou},
journal= {arXiv preprint arXiv:2110.06696},
year = {2021}
}