MOCHA:用于训练和评估生成式阅读理解指标的数据集
计算与语言
2021-06-08 v2 机器学习
摘要
将阅读理解视为生成问题提供了极大的灵活性,允许开放式问题且对可能答案限制很少。然而,现有生成指标依赖于词元重叠且对阅读理解的细微差别不知情,阻碍了进展。为此,我们引入了用于训练和评估生成式阅读理解指标的基准:MOdeling Correctness with Human Annotations(MOCHA)。MOCHA 包含来自 6 个多样化问答数据集的模型输出的 40K 人类判断分数,以及一组用于评估的最小对。使用 MOCHA,我们训练了用于阅读理解的习得评估指标 LERC,以模仿人类判断分数。LERC 在留出标注上比基线指标高出 10 到 36 个绝对皮尔逊点。当我们在最小对上评估鲁棒性时,LERC 达到 80% 准确率,比基线高出 14 到 26 个绝对百分点,同时仍有显著改进空间。MOCHA 为开发准确且鲁棒的生成式阅读理解指标提出了一个具有挑战性的问题。
引用
@article{arxiv.2010.03636,
title = {MOCHA: A Dataset for Training and Evaluating Generative Reading Comprehension Metrics},
author = {Anthony Chen and Gabriel Stanovsky and Sameer Singh and Matt Gardner},
journal= {arXiv preprint arXiv:2010.03636},
year = {2021}
}