统一自然语言生成中的人工与统计评估
计算与语言
2019-04-08 v1 人工智能
机器学习
摘要
我们如何衡量一个自然语言生成系统是否同时产生高质量且多样化的输出?人工评估能捕捉质量但无法捕捉多样性,因为它不能发现那些仅从训练集中剽窃的模型。另一方面,统计评估(即困惑度)能捕捉多样性却无法捕捉质量,因为偶尔输出低质量样本的模型不会受到充分惩罚。本文提出一个统一框架,基于预测一个句子是由人类还是机器生成的最优错误率,同时评估多样性与质量。我们证明该错误率可通过结合人工与统计评估高效估计,使用的评估度量称为HUSE。在摘要生成与闲聊对话上,我们表明:(i) HUSE能检测出欺骗纯人工评估的多样性缺陷;(ii) 诸如退火等提升质量的技术因多样性下降反而降低了HUSE。
引用
@article{arxiv.1904.02792,
title = {Unifying Human and Statistical Evaluation for Natural Language Generation},
author = {Tatsunori B. Hashimoto and Hugh Zhang and Percy Liang},
journal= {arXiv preprint arXiv:1904.02792},
year = {2019}
}
备注
NAACL Camera Ready Submission