中文

EVA2.0:基于大规模预训练的开域中文对话系统研究

计算与语言 2023-10-24 v3 人工智能

摘要

大规模预训练在构建开域对话系统方面已展现出卓越性能。然而,以往工作主要关注所发布对话模型的对话性能展示与评估,忽视了对构建强大类人聊天机器人若干关键因素(尤其是中文场景下的因素)的讨论。本文通过大量实验探究这些未被充分探索的因素,包括数据质量控制、模型架构设计、训练方法以及解码策略。我们提出 EVA2.0,一个拥有 28 亿参数的大规模预训练开域中文对话模型,并将公开我们的模型与代码。自动与人工评估表明,EVA2.0 显著优于其他开源同类模型。我们还通过呈现若干失败案例讨论了本工作的局限性,并提出了大规模中文开域对话系统的一些未来研究方向。

关键词

引用

@article{arxiv.2203.09313,
  title  = {EVA2.0: Investigating Open-Domain Chinese Dialogue Systems with Large-Scale Pre-Training},
  author = {Yuxian Gu and Jiaxin Wen and Hao Sun and Yi Song and Pei Ke and Chujie Zheng and Zheng Zhang and Jianzhu Yao and Lei Liu and Xiaoyan Zhu and Minlie Huang},
  journal= {arXiv preprint arXiv:2203.09313},
  year   = {2023}
}

备注

Machine Intelligence Research. https://link.springer.com/article/10.1007/s11633-022-1387-3 . 12 pages, 5 figures. The code and pre-trained models are publicly available at https://github.com/thu-coai/EVA