基于偏好数据的非参数 LLM 评估
机器学习
2026-01-30 v1
摘要
从人类偏好数据评估大型语言模型(LLM)的性能对于获取 LLM 排行榜至关重要。然而,许多现有方法要么依赖限制性的参数化假设,要么在采用灵活的机器学习方法时缺乏有效的不确定性量化。在本文中,我们提出了一个非参数统计框架 DMLEval,用于从偏好数据中比较和排序 LLM,采用去偏机器学习(DML)方法。为此,我们引入了广义平均排序分数(GARS),其概括了包括Bradley-Terry模型或PageRank/ Rank centrality在内的常用排序模型,涵盖包括平局在内的复杂人类响应。DMLEval具有以下优势:(i) 它产生统计上高效的GARS排序分数的估计值;(ii) 它自然地允许纳入用于估计的黑箱机器学习方法;(iii) 它可以与预训练的 LLM 评估器(例如使用 LLM 作为评判员)相结合;(iv) 它建议在预算约束下收集偏好数据的优化策略。我们在理论和实证层面都展示了这些优势,分别使用合成数据和真实世界的偏好数据集进行验证。总之,我们的框架为从业者提供了强大、最先进的方法,用于比较或排序 LLM。
引用
@article{arxiv.2601.21816,
title = {Nonparametric LLM Evaluation from Preference Data},
author = {Dennis Frauen and Athiya Deviyani and Mihaela van der Schaar and Stefan Feuerriegel},
journal= {arXiv preprint arXiv:2601.21816},
year = {2026}
}