基于 LLM 评估器的贝叶斯胜率校准
计算与语言
2024-12-25 v1 人工智能
摘要
近期大型语言模型 (LLM) 的进展表明,LLM 可作为评估器来评估文本生成 LLM 的质量。然而,直观地将 LLM 评估器用于比较或判断不同系统会导致结果不可靠,这源于 LLM 评估器固有的胜率估计偏差。为此,我们提出两种校准方法:贝叶斯胜率抽样 (BWRS) 和贝叶斯达奇-斯克恩 (Bayesian Dawid-Skene),两者均利用贝叶斯推断更准确地推断生成式语言模型的真实胜率。我们在覆盖故事生成、摘要生成和指令遵循等六个数据集上对方法进行经验验证。我们表明,两种方法均有效提升了使用 LLM 作为评估器进行胜率估计的准确性,为可靠的自动文本质量评估指明了前景方向。
引用
@article{arxiv.2411.04424,
title = {Bayesian Calibration of Win Rate Estimation with LLM Evaluators},
author = {Yicheng Gao and Gonghan Xu and Zhe Wang and Arman Cohan},
journal= {arXiv preprint arXiv:2411.04424},
year = {2024}
}
备注
Accepted by EMNLP 2024