高效 LLM 比较评估:面向两两比较的专家模型框架
计算与语言
2024-11-13 v3
摘要
LLM 作为评判官的方法是评估多种文本任务的实用且有效的方式。然而,在对一组候选对象进行两两比较排序时,计算成本随候选数量呈二次增长,这在实际中存在局限性。本文引入了面向 LLM 比较评估的专家模型 (Product of Expert, PoE) 框架。此处,个别比较被视为提供有关两者得分差异信息的专家。PoE 框架将这些专家的信息组合,以获得可针对底层候选集合进行最大化的表达式,且高度灵活,可假设任何形式的专家。当采用高斯专家时,可推导出关于最优候选排序的简单闭式解,以及用于选择应进行的比较以最大化此排序概率的表达式。我们的做法实现了高效的比较评估,通过仅使用一小部分可能的比较,即可生成与人类判断高度相关的得分预测。我们在多个自然语言生成任务上进行评估,表明该框架在进行两两比较评估时可实现显著的计算节省。对于大量候选文本,仅使用 2% 的比较即可获得与使用所有比较相当的性能。
引用
@article{arxiv.2405.05894,
title = {Efficient LLM Comparative Assessment: a Product of Experts Framework for Pairwise Comparisons},
author = {Adian Liusie and Vatsal Raina and Yassir Fathullah and Mark Gales},
journal= {arXiv preprint arXiv:2405.05894},
year = {2024}
}