中文

改进ROUGE与BLEU以更好评估机器阅读理解任务

计算与语言 2018-06-12 v1

摘要

当前基于问答的机器阅读理解(MRC)系统的评估指标通常关注候选答案与参考答案之间的词汇重叠,如ROUGE和BLEU。然而,当这些指标用于特定问题类型(尤其是询问是非观点和实体列表的问题)时可能出现偏差。本文对指标进行改进,使n-gram重叠更好地与这两类问题答案的人类判断相关联。统计分析证明了我们方法的有效性。我们的改进可为真实场景MRC系统的开发提供积极指导。

关键词

引用

@article{arxiv.1806.03578,
  title  = {Adaptations of ROUGE and BLEU to Better Evaluate Machine Reading Comprehension Task},
  author = {An Yang and Kai Liu and Jing Liu and Yajuan Lyu and Sujian Li},
  journal= {arXiv preprint arXiv:1806.03578},
  year   = {2018}
}

备注

7 pages, 2 figures, ACL 2018 MRQA Workshop camera-ready version