中文

GLIDER: 使用可解释排名对LLM交互与决策进行分级

计算与语言 2024-12-24 v2 人工智能

摘要

LLM作为评判者的范式越来越多地被用于模型输出的自动评估。虽然LLM评判者在受限评估任务上显示出潜力,但由于细粒度指标和可解释性的挑战,闭源LLM在现实世界应用中部署时表现出严重缺陷,而任务特定的评估模型缺乏跨领域泛化能力。我们引入了GLIDER,一个强大的3B评估器LLM,可以对任意用户定义标准上的任何文本输入和相关上下文进行评分。GLIDER在FLASK上显示出比GPT-4o更高的皮尔逊相关性,并且大大优于先前的评估模型,实现了与17倍大小的LLM相当的性能。GLIDER支持细粒度评分、多语言推理、跨度高亮,并在685个领域和183个标准上进行了训练。广泛的定性分析表明,GLIDER得分与人类判断高度相关,人类一致性达91.3%。我们已开源GLIDER以促进未来研究。

关键词

引用

@article{arxiv.2412.14140,
  title  = {GLIDER: Grading LLM Interactions and Decisions using Explainable Ranking},
  author = {Darshan Deshpande and Selvan Sunitha Ravi and Sky CH-Wang and Bartosz Mielczarek and Anand Kannappan and Rebecca Qian},
  journal= {arXiv preprint arXiv:2412.14140},
  year   = {2024}
}