中文

PLATO-XL:探索对话生成的大规模预训练

计算与语言 2022-10-20 v2

摘要

为探索对话生成预训练的极限,我们提出了参数量高达110亿的PLATO-XL模型,其训练数据来自中文和英文社交媒体对话。为训练如此大的模型,我们采用了具有高计算和参数效率的统一Transformer架构。此外,我们进行了多方感知预训练,以更好区分社交媒体对话中的特征信息。借助这些设计,PLATO-XL在中文和英文闲聊中均优于其他方法。我们进一步探索了PLATO-XL在其他对话任务上的能力,如知识 grounded 对话和任务型对话。实验结果表明,PLATO-XL在多个对话任务上取得了最先进的结果,验证了其作为对话AI基础模型的潜力。

关键词

引用

@article{arxiv.2109.09519,
  title  = {PLATO-XL: Exploring the Large-scale Pre-training of Dialogue Generation},
  author = {Siqi Bao and Huang He and Fan Wang and Hua Wu and Haifeng Wang and Wenquan Wu and Zhihua Wu and Zhen Guo and Hua Lu and Xinxian Huang and Xin Tian and Xinchao Xu and Yingzhan Lin and Zheng-Yu Niu},
  journal= {arXiv preprint arXiv:2109.09519},
  year   = {2022}
}

备注

Findings of AACL-IJCNLP 2022. First four authors contributed equally to this work