Prometheus 2:面向评估其他语言模型的开源语言模型
计算与语言
2024-12-06 v2
摘要
专有型如GPT-4等大型语言模型常被用于评估各种语言模型的响应质量。然而,由于透明性、可控性和可负担性等方面的顾虑,推动开发面向评估的开源语言模型。相反,现有的开源评估语言模型存在关键短板:1)它们给出的分数与人类评分显著偏离,2)它们缺乏灵活性以执行直接评估和两两排序这两种最常见的评估形式,此外,它们无法基于自定义评估标准进行评估,专注于通用属性如有帮助性和无害性。为此,我们引入Prometheus 2,一个比其前身更强大的评估语言模型,紧密模仿人类和GPT-4的判断。此外,它能够处理直接评估和两两排序格式,并可根据用户定义的评估标准进行处理。在四个直接评估基准和四个两两排序基准上,Prometheus 2在与人类和专有LM评判相关的相关性和一致性方面,超过了所有测试的开源评估语言模型。我们的所有模型、代码和数据均公开于 https://github.com/prometheus-eval/prometheus-eval。
引用
@article{arxiv.2405.01535,
title = {Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models},
author = {Seungone Kim and Juyoung Suk and Shayne Longpre and Bill Yuchen Lin and Jamin Shin and Sean Welleck and Graham Neubig and Moontae Lee and Kyungjae Lee and Minjoon Seo},
journal= {arXiv preprint arXiv:2405.01535},
year = {2024}
}
备注
EMNLP 2024 (Main Conference)