大语言模型评估中不确定性的实证分析
计算与语言
2025-03-04 v2 人工智能
摘要
随着 LLM-as-a-Judge 成为评估大语言模型(LLM)的新范式,人们对 LLM 评估器的一致性、偏差和稳定性提出了担忧。尽管已有大量工作关注一致性和偏差,但鲜有研究聚焦于 LLM 评估器的稳定性。在本文中,我们进行了广泛的实验,涉及 9 个广泛使用的 LLM 评估器和 2 种不同的评估设置,以调查基于模型的 LLM 评估中的不确定性。我们指出,LLM 评估器表现出基于模型系列和规模的不同不确定性。通过仔细的比较分析,我们发现采用特殊的提示策略,无论是在推理阶段还是训练后阶段,都能在一定程度上缓解评估不确定性。通过利用不确定性来增强 LLM 在分布外(OOD)数据上的可靠性和检测能力,我们进一步使用人工标注的微调集微调了一个名为 ConfiLM 的不确定性感知 LLM 评估器,并在源自 2024 年奥运会的人工设计测试集上评估了 ConfiLM 的 OOD 评估能力。实验结果表明,在微调阶段将不确定性作为附加信息可以大幅提高模型在 OOD 场景中的评估表现。代码和数据发布于:https://github.com/hasakiXie123/LLM-Evaluator-Uncertainty。
引用
@article{arxiv.2502.10709,
title = {An Empirical Analysis of Uncertainty in Large Language Model Evaluations},
author = {Qiujie Xie and Qingqiu Li and Zhuohao Yu and Yuejie Zhang and Yue Zhang and Linyi Yang},
journal= {arXiv preprint arXiv:2502.10709},
year = {2025}
}
备注
ICLR 2025