OpenMEVA:一个用于评估开放式故事生成指标的基准
计算与语言
2021-05-20 v1
摘要
自动指标对于开发自然语言生成(NLG)模型至关重要,特别是对于故事生成等开放式语言生成任务。然而,现有自动指标被观察到与人工评估的相关性较差。缺乏标准化的基准数据集使得全面评估一个指标的能力并公平比较不同指标变得困难。因此,我们提出了 OpenMEVA,一个用于评估开放式故事生成指标的基准。OpenMEVA 提供了一个全面的测试套件来评估指标的能力,包括(a)与人工判断的相关性,(b)对不同模型输出和数据集的泛化能力,(c)判断故事连贯性的能力,以及(d)对扰动的鲁棒性。为此,OpenMEVA 包含了人工标注的故事和自动构建的测试样例。我们在 OpenMEVA 上评估了现有指标,观察到它们与人工判断相关性差,无法识别语篇层面的不连贯,并且缺乏推理知识(例如事件之间的因果顺序)、泛化能力和鲁棒性。我们的研究为进一步研究开发 NLG 模型和指标提供了见解。
引用
@article{arxiv.2105.08920,
title = {OpenMEVA: A Benchmark for Evaluating Open-ended Story Generation Metrics},
author = {Jian Guan and Zhexin Zhang and Zhuoer Feng and Zitao Liu and Wenbiao Ding and Xiaoxi Mao and Changjie Fan and Minlie Huang},
journal= {arXiv preprint arXiv:2105.08920},
year = {2021}
}
备注
ACL 2021 Long Paper