中文

关于多跳推理中组合解释评估的挑战:相关性、完备性与专家评分

计算与语言 2021-09-09 v1 人工智能

摘要

构建组合解释要求模型组合两个或更多事实,共同说明某问题答案为何正确。通常,这些“多跳”解释是相对于一个(或少数)标准解释进行评估的。本工作中,我们显示此类评估严重低估模型性能,无论在所含事实的相关性方面,还是模型生成解释的完备性方面,因为模型经常发现并产出不同于标准解释的有效解释。为此,我们构建了由 126k 领域专家(科学教师)相关性评分组成的大型语料,扩充了标准化科学考试题解释语料,发现了 80k 个未被评为标准的相关事实。我们基于不同方法(生成、排序与图式)构建了三个强模型,并经验表明:尽管专家扩充评分提供了对解释质量更好的估计,但相较于完整人工专家判断,原始(标准)与专家扩充的自动评估仍低估性能达 36%,且不同模型受影响程度不均。这对准确评估组合推理模型所产解释提出了重大方法挑战。

关键词

引用

@article{arxiv.2109.03334,
  title  = {On the Challenges of Evaluating Compositional Explanations in Multi-Hop Inference: Relevance, Completeness, and Expert Ratings},
  author = {Peter Jansen and Kelly Smith and Dan Moreno and Huitzilin Ortiz},
  journal= {arXiv preprint arXiv:2109.03334},
  year   = {2021}
}

备注

Accepted to EMNLP 2021