评判评判者:面向在线评论生成的神经语言模型的大规模评估研究
计算与语言
2019-09-09 v2 机器学习
机器学习
摘要
我们开展了一项大规模、系统性的研究,以评估在生成在线产品评论场景下现有的自然语言生成评估方法。我们将基于人工的评估器与多种自动化评估流程进行了比较,包括衡量机器生成文本与人类撰写文本区分程度的判别式评估器,以及评估生成文本与人类撰写参考文本相似度的词重叠指标。我们确定了这些不同的评估器在针对十余种最先进的在线产品评论生成器的排名上的一致程度。我们发现,人工评估器与判别式评估器之间相关性较差,这留下了一个更大的问题:对抗准确率是否是自然语言生成的正确目标。总体而言,即使是人工评估者也很难区分机器生成的文本,且人类的决策与词汇重叠的相关性更好。我们发现词汇多样性是一个引人关注的指标,它能够指示不同评估器的评估结果。实验后对参与者的调查为如何评估和改进自然语言生成系统的质量提供了见解。
引用
@article{arxiv.1901.00398,
title = {Judge the Judges: A Large-Scale Evaluation Study of Neural Language Models for Online Review Generation},
author = {Cristina Garbacea and Samuel Carton and Shiyan Yan and Qiaozhu Mei},
journal= {arXiv preprint arXiv:1901.00398},
year = {2019}
}