CPT:一种面向中文语言理解与生成的非平衡预训练 Transformer
计算与语言
2022-07-19 v4
摘要
在本文中,我们利用已有的预训练模型(PTMs)并提出一种新颖的中文预训练非平衡 Transformer(CPT)。与以往的中文 PTM 不同,CPT 旨在利用自然语言理解(NLU)与自然语言生成(NLG)之间的共享知识来提升性能。CPT 由三部分组成:一个共享编码器、一个理解解码器和一个生成解码器。两个特定的解码器与共享编码器分别通过掩码语言建模(MLM)和去噪自编码(DAE)任务进行预训练。借助部分共享的架构与多任务预训练,CPT 能够(1)通过两个解码器学习 NLU 与 NLG 任务的特定知识,以及(2)灵活微调以充分挖掘模型潜力。此外,非平衡 Transformer 节省了计算与存储开销,使 CPT 具有竞争力并极大加速文本生成的推理。在广泛的中文 NLU 与 NLG 任务上的实验结果证明了 CPT 的有效性。
引用
@article{arxiv.2109.05729,
title = {CPT: A Pre-Trained Unbalanced Transformer for Both Chinese Language Understanding and Generation},
author = {Yunfan Shao and Zhichao Geng and Yitao Liu and Junqi Dai and Hang Yan and Fei Yang and Li Zhe and Hujun Bao and Xipeng Qiu},
journal= {arXiv preprint arXiv:2109.05729},
year = {2022}
}
备注
Code is available at https://github.com/fastnlp/CPT