无需哀伤的比较:基于生成可分性进行可靠偏好评估
代数几何
2024-07-03 v1 复变函数
摘要
人类通过成对偏好判断来评估生成的语言是普遍做法。然而,在常见情景下,例如当来自模型对的生成结果非常相似,或当随机解码导致生成结果差异很大时,这会导致不一致的偏好评分。我们通过引入一种称为可分性(separability)的元评估度量来解决这些挑战,该度量估计测试实例对于成对偏好评估的合适性。对于一个候选测试实例,separability 从模型对抽取多个生成结果,并衡量两个生成结果集合的可区分性。我们的实验表明,可分性值很高的实例能从人类和自动评估者那里获得更一致的偏好评分。进一步地,可分性的分布可提供有关哪些测试基准更适合比较模型的见解。最后,我们将可分性纳入 ELO 评级系统中,考虑每个测试实例在可靠排名 LLM 时的合适性。总体而言,可分性对人类和自动评估者而言,对 LLM 的一致性、效率和稳健偏好评估都有深远影响。
引用
@article{arxiv.2407.01877,
title = {Neighborhood of a rational curve with an ordinary cusp},
author = {Takayuki Koike and Takato Uehara},
journal= {arXiv preprint arXiv:2407.01877},
year = {2024}
}
备注
21 pages