MCQA-Eval:基于金标准正确性标签的自然语言生成中的高效置信度评估
计算与语言
2025-02-21 v1 人工智能
摘要
大型语言模型(LLM)需要稳健的置信度估计,尤其是在医疗和法律等关键领域,因不可靠的输出可能导致重大后果。尽管近期在置信度估计方面取得了大量工作,但现有的评估框架依赖于正确性函数——各种启发式方法常常噪声大、计算昂贵且可能引入系统性偏差。这些方法ological弱点倾向于扭曲评估指标,从而影响置信度测度的比较排名。我们引入MCQA-Eval,一个用于评估自然语言生成(NLG)中置信度测度的评估框架,通过利用来自多选题数据集的金标准正确性标签,消除对显式正确性函数的依赖。MCQA-Eval使能够系统比较基于内部状态的白盒(如基于logit的)和基于一致性的黑盒置信度测度,提供一种跨不同方法的统一评估方法。通过在多个LLM和广泛使用的QA数据集上的大量实验,我们报告MCQA-Eval提供的对置信度估计方法的高效且更可靠的评估优于现有方法。
引用
@article{arxiv.2502.14268,
title = {MCQA-Eval: Efficient Confidence Evaluation in NLG with Gold-Standard Correctness Labels},
author = {Xiaoou Liu and Zhen Lin and Longchao Da and Chacha Chen and Shubhendu Trivedi and Hua Wei},
journal= {arXiv preprint arXiv:2502.14268},
year = {2025}
}