Polyrating:一种用于LLM评估的经济高效且偏差感知的评分系统
计算与语言
2025-02-12 v3 人工智能
摘要
基于评分的人类评估已成为准确评估大型语言模型(LLM)令人印象深刻的性能的重要工具。然而,当前的评分系统存在几个重要的局限性:首先,它们未能考虑显著影响评估结果的偏差;其次,它们需要大量且昂贵的人类偏好数据集才能获得准确的评分;第三,它们不便于跨不同任务对模型评分进行有意义的比较。为了解决这些问题,我们引入了Polyrating,这是一种基于最大后验估计的表达性强且灵活的评分系统,能够以更低的成本对模型性能进行更细致和彻底的分析。Polyrating可以检测并量化影响人类偏好的偏差,确保更公平的模型比较。此外,通过利用现有的基准分数,Polyrating可以将新模型的人类评估成本降低高达41%,将新任务的成本降低高达77%。最后,Polyrating支持跨不同任务直接比较评分,从而全面了解LLM在不同应用中的优势、劣势和相对性能。
引用
@article{arxiv.2409.00696,
title = {Polyrating: A Cost-Effective and Bias-Aware Rating System for LLM Evaluation},
author = {Jasper Dekoninck and Maximilian Baader and Martin Vechev},
journal= {arXiv preprint arXiv:2409.00696},
year = {2025}
}