中文

面向对话生成的选择性数据增强学习

计算与语言 2023-03-20 v1

摘要

由于获取大量数据来训练神经对话模型繁琐且昂贵,人们提出数据增强以有效利用现有训练样本。然而,当前对话生成任务上的数据增强技术大多对训练数据集中的所有样本进行增强,而未考虑不同样本之间的内在属性。我们认为并非所有样本都对增强任务有益,适合增强的样本应遵循以下两个属性:(1) 低质量(对话模型无法为该样本生成高质量回复),(2) 代表性(样本应代表整个数据集的特性)。为此,我们提出一种用于回复生成任务的选择性数据增强框架(SDA)来探索这一思路。SDA 采用双对抗网络在一个阶段中筛选出质量最低且最具代表性的数据点进行增强。在 DailyDialog 和 OpenSubtitles 两个公开数据集上进行的广泛实验表明,我们的框架能在各项指标上提升回复生成性能。

关键词

引用

@article{arxiv.2303.09719,
  title  = {Learning towards Selective Data Augmentation for Dialogue Generation},
  author = {Xiuying Chen and Mingzhe Li and Jiayi Zhang and Xiaoqiang Xia and Chen Wei and Jianwei Cui and Xin Gao and Xiangliang Zhang and Rui Yan},
  journal= {arXiv preprint arXiv:2303.09719},
  year   = {2023}
}

备注

9 pages, 4 figures, AAAI 2023