估计大语言模型置信度的方法
计算与语言
2023-12-11 v2 人工智能
摘要
大语言模型在传达不确定性方面存在困难,这是将LLMs应用于复杂医疗任务的重大障碍。本研究评估了在为挑战性临床病例建议诊断时衡量LLM置信度的方法。使用思维链(Chain of Thought)和自洽性(Self Consistency)提示向GPT4提出了一系列挑战性病例问题。研究探讨了多种方法来评估模型置信度,并评估了它们预测模型观测准确性的能力。评估的方法包括内在置信度、SC一致性频率和CoT响应长度。SC一致性频率与观测准确性相关,与内在置信度和CoT长度分析相比,产生了更高的受试者工作特征曲线下面积。SC一致性是模型置信度最有用的代理指标,尤其是在医疗诊断方面。模型内在置信度和CoT响应长度在区分正确和错误答案方面的能力较弱,使其无法成为模型置信度可靠且可解释的标志。我们得出结论,GPT4评估自身诊断准确性的能力有限。SC一致性频率是衡量GPT4置信度最有用的方法。
引用
@article{arxiv.2312.03733,
title = {Methods to Estimate Large Language Model Confidence},
author = {Maia Kotelanski and Robert Gallo and Ashwin Nayak and Thomas Savage},
journal= {arXiv preprint arXiv:2312.03733},
year = {2023}
}