一种用于基于人格对话生成的模型无关数据操纵方法
计算与语言
2022-04-22 v1 人工智能
摘要
在构建智能对话代理方面,将显式人格引入生成模型引起了越来越多的关注。然而,由于手头基于人格的对话数据有限,可能难以训练好一个对话生成模型。我们指出该生成任务的数据挑战在于两个方面:首先,扩展当前基于人格的对话数据集代价高昂;其次,该任务中每个数据样本比传统对话数据更难学习。为缓解上述数据问题,我们提出了一种数据操纵方法,该方法模型无关,可与任何基于人格的对话生成模型打包以提升其性能。原始训练样本将首先被蒸馏,从而预期更容易拟合。接下来,我们展示了多种可有效使此类更易蒸馏数据多样化的方式。然后,给定的基模型将通过构建的数据课程进行训练,即先在增强的蒸馏样本上训练,再在原始样本上训练。实验以两个强基对话模型(Transformer编码器-解码器和GPT2)说明了我们方法的优越性。
引用
@article{arxiv.2204.09867,
title = {A Model-Agnostic Data Manipulation Method for Persona-based Dialogue Generation},
author = {Yu Cao and Wei Bi and Meng Fang and Shuming Shi and Dacheng Tao},
journal= {arXiv preprint arXiv:2204.09867},
year = {2022}
}
备注
Accepted to ACL 2022 (long paper)