改进ROUGE与BLEU以更好评估机器阅读理解任务
计算与语言
2018-06-12 v1
摘要
当前基于问答的机器阅读理解(MRC)系统的评估指标通常关注候选答案与参考答案之间的词汇重叠,如ROUGE和BLEU。然而,当这些指标用于特定问题类型(尤其是询问是非观点和实体列表的问题)时可能出现偏差。本文对指标进行改进,使n-gram重叠更好地与这两类问题答案的人类判断相关联。统计分析证明了我们方法的有效性。我们的改进可为真实场景MRC系统的开发提供积极指导。
引用
@article{arxiv.1806.03578,
title = {Adaptations of ROUGE and BLEU to Better Evaluate Machine Reading Comprehension Task},
author = {An Yang and Kai Liu and Jing Liu and Yajuan Lyu and Sujian Li},
journal= {arXiv preprint arXiv:1806.03578},
year = {2018}
}
备注
7 pages, 2 figures, ACL 2018 MRQA Workshop camera-ready version