中文

以评审团取代法官:用多样化模型小组评估大语言模型生成

计算与语言 2024-05-02 v2 人工智能

摘要

随着大语言模型(LLMs)日益先进,我们准确评估其质量的能力已跟不上其发展步伐。不仅寻找能充分探测特定模型属性的数据十分困难,仅评估模型自由形式生成结果的正确性本身也是一项挑战。为解决这一问题,许多评估现在依赖于使用大语言模型自身作为评判者,来对其他大语言模型的输出质量进行评分。评估最常使用像GPT4这样的单一大型模型。尽管这种方法日益流行,但它成本高昂,已被证明会引入模型内偏差,并且在本工作中,我们发现非常大的模型往往并非必要。我们提出改用大语言模型评估者小组(PoLL)来评估模型。在三种不同的评判设置和六个不同数据集上,我们发现,与单一大型评判模型相比,由更多较小模型组成的PoLL表现更优,由于其由不相交的模型家族构成,展现出更少的模型内偏差,同时成本降低了七倍以上。

关键词

引用

@article{arxiv.2404.18796,
  title  = {Replacing Judges with Juries: Evaluating LLM Generations with a Panel of Diverse Models},
  author = {Pat Verga and Sebastian Hofstatter and Sophia Althammer and Yixuan Su and Aleksandra Piktus and Arkady Arkhangorodsky and Minjie Xu and Naomi White and Patrick Lewis},
  journal= {arXiv preprint arXiv:2404.18796},
  year   = {2024}
}