表到文本生成评估中参考文本发散问题的处理
计算与语言
2019-06-05 v1
摘要
用于从半结构化数据(表格)生成文本的自动构建数据集(如 WikiBio)通常包含与相应半结构化数据信息不一致的参考文本。我们表明,当这些参考文本发生发散时,仅依赖参考文本的指标(如 BLEU 和 ROUGE)与人类判断的相关性较差。我们提出一种新指标 PARENT,在计算精确率与召回率之前,将参考文本和生成文本中的 n-gram 与半结构化数据对齐。通过对 WikiBio 的表到文本模型进行大规模人工评估研究,我们表明 PARENT 与人工判断的相关性优于现有文本生成指标。我们还改编并评估了 Wiseman 等人(2017)提出的基于信息抽取的评价方法,并表明 PARENT 与其具有相当的相关性,同时更易于使用。我们展示了 PARENT 也适用于使用 WebNLG 挑战赛数据从人类处获取的参考文本。
引用
@article{arxiv.1906.01081,
title = {Handling Divergent Reference Texts when Evaluating Table-to-Text Generation},
author = {Bhuwan Dhingra and Manaal Faruqui and Ankur Parikh and Ming-Wei Chang and Dipanjan Das and William W. Cohen},
journal= {arXiv preprint arXiv:1906.01081},
year = {2019}
}
备注
To appear at ACL 2019