中文

多选项设定下对齐语言模型的不确定性校准研究

机器学习 2023-11-21 v2 计算与语言

摘要

尽管对齐语言模型(LM)在实际应用上取得了显著进展,与相应的预训练 LM 相比,它们往往对输出答案过于自信。本文中,我们系统评估了多选项设定下对齐过程对基于 logit 的 LM 不确定性校准的影响。我们首先开展了一项细致的经验研究,考察对齐 LM 在校准上与其预训练对应模型的差异。实验结果表明,多选项设定下 LM 中存在两种不同的不确定性,分别负责 LM 的答案决策与格式偏好。随后,我们通过简单合成对齐方案中的微调研究这两种不确定性在对齐 LM 校准中的作用,并得出结论:对齐 LM 过度自信的一个原因是这两类不确定性的混淆。此外,我们检验了常见事后校准方法在对齐 LM 上的效用,并提出了一种易于实现且样本高效的方法来校准对齐 LM。我们希望我们的发现能为设计更可靠 LM 对齐过程提供见解。

关键词

引用

@article{arxiv.2310.11732,
  title  = {Investigating Uncertainty Calibration of Aligned Language Models under the Multiple-Choice Setting},
  author = {Guande He and Peng Cui and Jianfei Chen and Wenbo Hu and Jun Zhu},
  journal= {arXiv preprint arXiv:2310.11732},
  year   = {2023}
}