中文

通过引发忠实度校准大语言模型的置信度

计算与语言 2024-10-10 v2

摘要

使用RLHF等技术优化的大语言模型在有用性和无害性方面已经实现了良好的对齐。然而,对齐后,这些语言模型常常表现出过度自信,即表达的置信度与其正确率不能准确校准。在本文中,我们将语言模型置信度分解为关于问题的《不确定性》和关于语言模型生成答案的《忠实度》。然后,我们提出了一种即插即用的方法来估计语言模型的置信度。通过在四个MCQA数据集上对6个RLHF-LM进行实验,我们的方法显示出良好的校准性能。此外,我们提出了两个新指标IPR和CE来评估模型的校准,并对《真正良好校准的置信度》进行了详细讨论。我们的方法可以作为强基线,我们希望这项工作能为模型置信度校准提供一些见解。

关键词

引用

@article{arxiv.2404.02655,
  title  = {Calibrating the Confidence of Large Language Models by Eliciting Fidelity},
  author = {Mozhi Zhang and Mianqiu Huang and Rundong Shi and Linsen Guo and Chong Peng and Peng Yan and Yaqian Zhou and Xipeng Qiu},
  journal= {arXiv preprint arXiv:2404.02655},
  year   = {2024}
}

备注

EMNLP 2024