大规模中文短文本对话数据集
计算与语言
2022-04-27 v2
摘要
神经对话生成模型的进展在短文本对话建模上展现出有前景的结果。然而,训练此类模型通常需要大规模高质量对话语料,而这难以获取。本文提出一个大规模清洗后的中文对话数据集 LCCC,其包含基础版(680 万对话)和大型版(1200 万对话)。我们数据集的质量由严格的数据清洗流程保证,该流程基于一组规则以及一个在人工标注的 11 万对话对上训练的分类器构建。我们还发布了分别在 LCCC-base 和 LCCC-large 上预训练的对话模型。清洗后的数据集与预训练模型将促进短文本对话建模的研究。所有模型与数据集均可在 https://github.com/thu-coai/CDial-GPT 获取。
引用
@article{arxiv.2008.03946,
title = {A Large-Scale Chinese Short-Text Conversation Dataset},
author = {Yida Wang and Pei Ke and Yinhe Zheng and Kaili Huang and Yong Jiang and Xiaoyan Zhu and Minlie Huang},
journal= {arXiv preprint arXiv:2008.03946},
year = {2022}
}
备注
Accepted by NLPCC 2020 (Best Student Paper)