羊驼知而 GPT 未显:用于置信度估计的代理模型
计算与语言
2023-11-16 v1 机器学习
摘要
为维持用户信任,大语言模型(LLMs)应在其出错的样本上给出低置信度信号,而非误导用户。估计置信度的标准方法是使用这些模型的 softmax 概率,但截至 2023 年 11 月,诸如 GPT-4 与 Claude-v1.3 等最先进 LLM 并不提供这些概率的访问权限。我们首先研究以语言方式引出置信度——即向 LLM 询问其对自己答案的置信度——其表现尚可(在 12 个问答数据集上 GPT-4 平均 AUC 为 80.5%,高于随机基线 7%),但仍有改进空间。随后我们探索使用代理置信度模型——借助一个我们可获取概率的模型来评估原模型在给定问题上的置信度。令人惊讶的是,尽管这些概率来自一个不同且通常更弱的模型,该方法在 12 个数据集中有 9 个取得了高于语言置信度的 AUC。我们组合语言置信度与代理模型概率的最佳方法在所有 12 个数据集上给出了最先进的置信度估计(GPT-4 上平均 AUC 为 84.6%)。
关键词
引用
@article{arxiv.2311.08877,
title = {Llamas Know What GPTs Don't Show: Surrogate Models for Confidence Estimation},
author = {Vaishnavi Shrivastava and Percy Liang and Ananya Kumar},
journal= {arXiv preprint arXiv:2311.08877},
year = {2023}
}