中文

我们如何得知语言模型何时知晓?论问答中语言模型的校准

计算与语言 2021-05-21 v2

摘要

近期研究表明,语言模型(LM)能够捕捉有关事实或常识的不同类型知识。然而,由于没有任何模型是完美的,它们在许多情况下仍无法提供恰当答案。在本文中,我们提出这样的问题:“我们如何能够确信地知道,语言模型何时知晓某一特定查询的答案?”我们从校准的角度审视该问题,校准是指概率模型预测的概率实际上与正确性的概率良好相关的性质。我们考察了三个强大的生成模型——T5、BART和GPT-2——并研究它们在问答任务上的概率是否经过良好校准,发现答案相当明确地是否定的。随后我们考察了通过微调、事后概率修正或调整预测输出或输入来校准此类模型的方法,以使其置信度分数与正确性可能性更好地相关。在多样化数据集上的实验证明了我们方法的有效性。我们还进行分析以研究这些方法的优势与局限,为LM校准方法的进一步改进提供启示。我们已在https://github.com/jzbjyb/lm-calibration发布了代码。

关键词

引用

@article{arxiv.2012.00955,
  title  = {How Can We Know When Language Models Know? On the Calibration of Language Models for Question Answering},
  author = {Zhengbao Jiang and Jun Araki and Haibo Ding and Graham Neubig},
  journal= {arXiv preprint arXiv:2012.00955},
  year   = {2021}
}

备注

TACL 2021