中文

ReCEval:通过正确性与信息量评估推理链

计算与语言 2023-12-04 v2 人工智能 机器学习

摘要

多步推理能力是许多自然语言任务的基础,然而目前尚不清楚什么是好的推理链以及如何评估它们。大多数现有方法仅关注推理链是否导出正确结论,但这种以答案为导向的视角可能将推理质量与其他用于预测答案的虚假捷径相混淆。为弥补这一差距,我们将推理链视为推导最终答案的非形式化证明来评估它们。具体而言,我们提出 ReCEval(推理链评估),一个通过两个关键属性评估推理链的框架:(1)正确性,即每一步基于该步内、前序步骤及输入上下文所含信息做出有效推断;(2)信息量,即每一步提供有助于推导所生成答案的新信息。我们利用自然语言推理模型和 V-Information 开发指标来评估这些属性。在多个数据集上,我们表明 ReCEval 能有效识别各类错误类型,并相较先前方法取得显著提升。我们分析了步边界和前序步骤对评估正确性的影响,并证明我们的信息量指标捕捉到了高质量推理链中预期的信息流。最后,我们展示基于 ReCEval 对推理链评分可提升下游任务性能。我们的代码公开于:https://github.com/archiki/ReCEval

关键词

引用

@article{arxiv.2304.10703,
  title  = {ReCEval: Evaluating Reasoning Chains via Correctness and Informativeness},
  author = {Archiki Prasad and Swarnadeep Saha and Xiang Zhou and Mohit Bansal},
  journal= {arXiv preprint arXiv:2304.10703},
  year   = {2023}
}

备注

EMNLP 2023 camera-ready (21 pages)