中文

LACIE:面向大型语言模型置信度校准的听众感知微调

计算与语言 2024-07-04 v2 人工智能

摘要

在回答问题时,LLM不仅能传达答案,还能传达对答案正确性的置信度水平。这包括显式的置信度标记(例如给出数值分数)以及隐式标记,如权威性的语气或用额外知识进行阐述。要使LLM成为可信赖的知识来源,它们所传达的置信度应与其实际专业知识相匹配;然而,当前大多数模型倾向于过度自信。为了校准隐式和显式的置信度标记,我们引入了一种实用的、听众感知的微调方法(LACIE),该方法对听众进行建模,不仅考虑答案是否正确,还考虑它是否会被听众接受。我们将校准视为偏好优化,通过一个双智能体博弈创建数据,其中说话者模型的输出由模拟听众评判。然后,我们使用LACIE对三个LLM(Mistral-7B、Llama3-8B、Llama3-70B)进行微调,并表明所得模型相对于模拟听众的校准效果更好。至关重要的是,这些趋势会迁移到人类听众身上,帮助他们正确预测模型的正确性:我们进行了一项人工评估,让标注者接受或拒绝LLM的答案,发现使用LACIE训练后,错误答案被接受的比例减少了47%,同时正确答案的接受率保持不变。此外,LACIE可以泛化到另一个数据集,当在TriviaQA上训练时,在TruthfulQA上的真实性大幅提升。我们的分析表明,LACIE使得正确与错误示例之间的置信度分离更好。定性分析发现,经过LACIE训练的模型会更多地使用模糊性表达,并在正确时通过使用权威性语气或包含细节来隐式地传达确定性。最后,LACIE微调导致模型对可能错误的答案的弃权行为(例如说“我不知道”)出现增加。

关键词

引用

@article{arxiv.2405.21028,
  title  = {LACIE: Listener-Aware Finetuning for Confidence Calibration in Large Language Models},
  author = {Elias Stengel-Eskin and Peter Hase and Mohit Bansal},
  journal= {arXiv preprint arXiv:2405.21028},
  year   = {2024}
}

备注

18 pages. Code: https://github.com/esteng/pragmatic_calibration