基于相互一致性的 Poor-Supervised Evaluation for SuperLLM
计算与语言
2024-08-27 v1
摘要
来自能力评估的指导极大推动了人类社会和人工智能的进步。然而,随着大语言模型(LLM)的演变,构建面向它们的评估基准显得愈发困难,因为难以在接近人类能力边界的硬任务上获得准确标签。为在缺乏准确标签的情况下可信地进行评估(即 poor-supervised evaluation),我们提出了 PoEM 框架。我们首先证明,在预测分布独立且样本数为无限的情况下,模型的能力可等价地通过其与特定参考模型之间的一致性来评估。为缓解现实条件下的不足,进一步引入一种算法,将人类(当可用时)和待评估模型视为参考模型,交替进行模型权重校准和过滤,分别在 E 步和 M 步中实现。广泛的实验在 3 种任务类型和 16 个主流 LLM 上表明,PoEM 在 poor supervision 下能实现与 supervised evaluation 结果之间平均 0.98 的 Pearson 相关系数,显示出良好的有效性、效率和通用性。更一般地,PoEM 推动了评估范式从以人类为中心向以人类&模型为中心的演进,通过将两者都视为参考模型,缓解了在 LLM 时代的人类评估局限性。
引用
@article{arxiv.2408.13738,
title = {Poor-Supervised Evaluation for SuperLLM via Mutual Consistency},
author = {Peiwen Yuan and Shaoxiong Feng and Yiwei Li and Xinglin Wang and Boyuan Pan and Heda Wang and Yao Hu and Kan Li},
journal= {arXiv preprint arXiv:2408.13738},
year = {2024}
}
备注
ACL findings