一种通过最小化长尾效应改善对话生成的数据归一化新方法
计算与语言
2020-05-05 v1 人工智能
机器学习
摘要
近期的神经模型在对话生成方面取得了显著进展。大多数生成模型基于语言模型。然而,由于语言学中的长尾现象,训练后的模型倾向于生成在训练数据集中频繁出现的词,导致单调问题。为解决此问题,我们分析了来自维基百科的大型语料库,并提出了三种基于频率的数据归一化方法。我们基于transformers以及分别从社交媒体、字幕和工业应用中收集的三个数据集进行了大量实验。实验结果表明,生成回复的多样性和信息量(定义为名词和动词的数量)均有显著提升。更具体地,在三个数据集上,一元和二元多样性分别提高了2.6%–12.6%和2.2%–18.9%。此外,信息量即名词和动词的数量分别提高了4.0%–7.0%和1.4%–12.1%。另外,方法的简洁性和有效性使其能够在无需太多额外计算成本的情况下适配不同的生成模型。
引用
@article{arxiv.2005.01278,
title = {A New Data Normalization Method to Improve Dialogue Generation by Minimizing Long Tail Effect},
author = {Zhiqiang Zhan and Zifeng Hou and Yang Zhang},
journal= {arXiv preprint arXiv:2005.01278},
year = {2020}
}