中文

重新审视校准:以问答为例

计算与语言 2022-10-25 v2

摘要

为了让用户信任模型预测,他们需要理解模型输出,尤其是其置信度——校准旨在调整(校准)模型的置信度以匹配期望准确率。我们认为传统的校准评估并不能促进有效的校准:例如,它可能鼓励对所有预测始终赋予平庸的置信度分数,这无助于用户区分正确与错误预测。基于这些观察,我们提出一种新的校准指标MacroCE,能更好地捕捉模型是否对错误预测赋予低置信度、对正确预测赋予高置信度。聚焦于开放域问答这一实际应用,我们考察了广泛应用于检索-阅读器流水线上的常规校准方法,这些方法在我们的新MacroCE指标下均未带来显著提升。为获得更好校准,我们提出一种新校准方法(ConsCal),其不仅利用最终模型预测,还利用多个模型检查点是否作出一致预测。总之,我们提供了校准的替代视角及新指标,在我们的指标下重新评估现有校准方法,并提出了更有效的校准方法。

关键词

引用

@article{arxiv.2205.12507,
  title  = {Re-Examining Calibration: The Case of Question Answering},
  author = {Chenglei Si and Chen Zhao and Sewon Min and Jordan Boyd-Graber},
  journal= {arXiv preprint arXiv:2205.12507},
  year   = {2022}
}

备注

EMNLP 2022 Findings