InternalInspector $I^2$:通过内部状态提升LLM鲁棒置信度估计
计算与语言
2024-06-19 v1
摘要
尽管大型语言模型(LLM)拥有强大的能力,但它们常常难以生成可靠的输出,频繁产生被称为幻觉的高置信度错误。为解决这一挑战,我们的研究引入了InternalInspector——一种新型框架,通过对内部状态(包括注意力状态、前馈状态以及所有层的激活状态)进行对比学习来增强LLM的置信度估计。与现有方法主要关注最终激活状态不同,InternalInspector在每个层的所有内部状态上进行全面分析,以准确识别正确和错误的预测过程。通过在各种自然语言理解和生成任务上对InternalInspector进行基准测试,包括事实性问答、常识推理和阅读理解,InternalInspector在将估计置信度得分与LLM预测正确性高度一致以及降低校准误差方面显著优于现有置信度估计方法。此外,InternalInspector在HaluEval基准测试中表现突出,优于其他基于内部状态的置信度估计方法。
引用
@article{arxiv.2406.12053,
title = {InternalInspector $I^2$: Robust Confidence Estimation in LLMs through Internal States},
author = {Mohammad Beigi and Ying Shen and Runing Yang and Zihao Lin and Qifan Wang and Ankith Mohan and Jianfeng He and Ming Jin and Chang-Tien Lu and Lifu Huang},
journal= {arXiv preprint arXiv:2406.12053},
year = {2024}
}
备注
8 pages