面向更优的自动问题生成系统评价度量
计算与语言
2018-09-03 v2
摘要
对于使用基于 -gram 的相似度度量(如 BLEU、NIST 等)来评估 NLG 系统性能,一直存在批评。然而,这些度量仍然流行,且最近被用于评估从文档、知识图谱、图像等自动生成问题的系统性能。鉴于此类自动问题生成(AQG)系统日益受到关注,客观审视这些度量是否适用于该任务十分重要。特别是,需验证用于评估 AQG 系统的此类度量是否通过偏好包含问题类型(Wh-类型)、实体、关系等所有相关信息的可回答性问题来关注生成问题的可回答性。本工作中,我们表明当前基于 -gram 相似度的自动评价度量并不总是与人类关于问题可回答性的判断良好相关。为缓解此问题并作为迈向更优 AQG 评价度量的第一步,我们引入一个捕获可回答性的评分函数,并表明当该评分函数与现有度量结合时,它们与人类判断的相关性显著更好。作为本工作一部分开发的脚本和数据已在 https://github.com/PrekshaNema25/Answerability-Metric 公开提供。
引用
@article{arxiv.1808.10192,
title = {Towards a Better Metric for Evaluating Question Generation Systems},
author = {Preksha Nema and Mitesh M. Khapra},
journal= {arXiv preprint arXiv:1808.10192},
year = {2018}
}
备注
10 pages