SkillAggregation:无参考的 LLM 依赖聚合方法
计算与语言
2024-10-15 v1 机器学习
摘要
大型语言模型(LLM)因其能够生成类似人类的判断而日益增多地用于评估 NLP 任务。最初使用单个 LLM,但近期研究表明,使用多个 LLM 作为评判员可获得更好的性能。利用多个判断的关键步骤之一是组合阶段,聚合。现有 NLP 方法要么赋予所有 LLM 判断相同的权重,要么为特定任务(如幻觉检测)设计。本工作聚焦于在没有参考标签的情况下聚合来自多个系统的预测。提出一种新方法称为 SkillAggregation,通过学习无需额外数据或 ground truth 的 LLM 评判员的组合估计。它扩展了开发用于图像分类的 Crowdlayer 聚合方法,以在推理期间利用评判员估计。该方法在 HaluEval-Dialogue、TruthfulQA 和 Chatbot Arena 任务上与一系列标准聚合方法进行比较。SkillAggregation 在所有任务上均优于 Crowdlayer,并在大多数任务上实现最佳性能。
引用
@article{arxiv.2410.10215,
title = {SkillAggregation: Reference-free LLM-Dependent Aggregation},
author = {Guangzhi Sun and Anmol Kagrecha and Potsawee Manakul and Phil Woodland and Mark Gales},
journal= {arXiv preprint arXiv:2410.10215},
year = {2024}
}