分布差异:一种无条件文本生成的度量指标
计算与语言
2020-07-03 v2
摘要
无条件文本生成的目的在于以真实句子训练模型,进而生成与训练数据质量和多样性相当的新句子。然而,当使用不同度量比较无条件文本生成方法时,会得出相互矛盾的结论。难点在于评估模型时需同时考虑样本的多样性和质量。为解决该问题,设计了一种新颖的分布差异(DD)度量,基于生成句子与真实训练句子间的差异来评估生成器。但由于真实句子的分布不可得,无法直接计DD。因此我们提出通过训练基于神经网络的文本分类器估计DD的方法。为比较,使用三种已有度量——双语评估替补(BLEU)对自BLEU、语言模型分数对逆语言模型分数、以及Fréchet嵌入距离,连同所提DD,在句法数据和真实数据上评估两种流行的生成模型长短期记忆和生成式预训练Transformer 2。实验结果表明,在对这些生成模型排序方面,DD显著优于三种已有度量。
引用
@article{arxiv.2005.01282,
title = {Distributional Discrepancy: A Metric for Unconditional Text Generation},
author = {Ping Cai and Xingyuan Chen and Peng Jin and Hongjun Wang and Tianrui Li},
journal= {arXiv preprint arXiv:2005.01282},
year = {2020}
}