修补开裂的地基:生成文本评估实践中的障碍综述
计算与语言
2022-02-15 v1 人工智能
机器学习
摘要
自然语言生成(NLG)中的评估实践存在诸多已知缺陷,但改进的评估方法很少被广泛采用。这一问题已变得更加紧迫,因为神经 NLG 模型已改进到常无法再依据旧有指标所依赖的表层特征加以区分的程度。本文综述了过去 20 年间指出的 NLG 中人与自动模型评估以及常用数据集存在的问题。我们总结、分类并讨论了研究者如何着手解决这些问题,以及他们的发现对当前模型评估状况意味着什么。基于这些见解,我们提出了 NLG 评估的长期愿景,并为研究者改进其评估流程给出具体步骤。最后,我们分析了近期 NLP 会议上的 66 篇 NLG 论文在多大程度上已遵循这些建议,并识别出哪些领域需要对现状进行更剧烈的变革。
引用
@article{arxiv.2202.06935,
title = {Repairing the Cracked Foundation: A Survey of Obstacles in Evaluation Practices for Generated Text},
author = {Sebastian Gehrmann and Elizabeth Clark and Thibault Sellam},
journal= {arXiv preprint arXiv:2202.06935},
year = {2022}
}