中文

Fact-and-Reflection (FaR) 提升大语言模型的置信度校准

计算与语言 2024-09-10 v2

摘要

为了使大语言模型(LLM)值得信赖,其置信度水平应与其实际表现良好校准。虽然 LLM 性能受提示词影响巨大已成为常识,但针对提示 LLM 的置信度校准尚未得到充分探索。本文探讨了不同提示策略如何影响 LLM 置信度校准及其改进方法。我们在问答语境下对六种提示方法进行了广泛实验,观察到这些方法虽有助于改善预期的 LLM 校准,但也导致 LLM 在回应某些实例时过度自信。受人类认知启发,我们提出了 Fact-and-Reflection (FaR) 提示法,通过两个步骤改进 LLM 校准:首先,FaR 从 LLM 中提取与输入提示相关的已知“事实”;然后,要求模型对这些事实进行“反思”以生成最终答案。实验表明,FaR 提示法实现了显著更好的校准效果,在我们的多用途问答任务上将预期校准误差(Expected Calibration Error)降低了 23.5%。值得注意的是,FaR 提示法甚至能激发模型在置信度较低的场景中以语言形式表达顾虑,从而有助于触发检索增强以解决这些更难的实例。

关键词

引用

@article{arxiv.2402.17124,
  title  = {Fact-and-Reflection (FaR) Improves Confidence Calibration of Large Language Models},
  author = {Xinran Zhao and Hongming Zhang and Xiaoman Pan and Wenlin Yao and Dong Yu and Tongshuang Wu and Jianshu Chen},
  journal= {arXiv preprint arXiv:2402.17124},
  year   = {2024}
}

备注

17 pages, 10 figures