中文

ROSCOE:逐步推理评分的指标套件

计算与语言 2023-09-13 v2 机器学习

摘要

大型语言模型在被提示生成逐步推理以证明其最终答案时,下游任务性能有所提升。这些推理步骤大大改善了模型的可解释性与可验证性,但在缺乏可靠自动评估方法的情况下,客观研究其正确性(独立于最终答案)十分困难。我们根本不知道所陈述的推理步骤实际支持最终任务预测的频率有多高。在这项工作中,我们提出 ROSCOE,一套可解释、无监督的自动评分指标,改进并扩展了先前的文本生成评估指标。为针对基线指标评估 ROSCOE,我们设计了一套推理错误类型学,并在常用推理数据集上收集了合成与人类评估分数。与现有指标相比,ROSCOE 能够利用逐步理由的特性来衡量语义一致性、逻辑性、信息量、流畅性和事实性——以及其他特征。我们在五个经人类标注和六个程序化扰动的诊断数据集上实证验证了我们的指标强度——涵盖需要推理技能的多样化任务,并表明 ROSCOE 能持续优于基线指标。

关键词

引用

@article{arxiv.2212.07919,
  title  = {ROSCOE: A Suite of Metrics for Scoring Step-by-Step Reasoning},
  author = {Olga Golovneva and Moya Chen and Spencer Poff and Martin Corredor and Luke Zettlemoyer and Maryam Fazel-Zarandi and Asli Celikyilmaz},
  journal= {arXiv preprint arXiv:2212.07919},
  year   = {2023}
}