LLM-Rubric:一种多维、校准的自然语言文本自动评估方法
计算与语言
2025-01-03 v1
摘要
本文介绍了一种自然语言文本自动评估框架。手动构建的评分标准描述了如何评估多个感兴趣的维度。为了评估文本,大型语言模型(LLM)被提示每个评分标准问题,并产生一个潜在响应的分布。LLM的预测往往与人类评判者不一致——事实上,人类之间也并非完全一致。然而,多个LLM分布可以起来每个人类评判者在所有问题上的标注,包括评估整体质量或相关性的总结性问题。LLM-Rubric通过训练一个包含评判者特定参数和评判者无关参数的小型前馈神经网络来实现这一点。在评估人机信息寻求任务中的对话系统时,我们发现,使用9个问题(评估自然度、简洁性、引用质量等维度)的LLM-Rubric预测人类评判者对整体用户满意度的评估(1-4分制)的均方根误差小于0.5,比未校准基线提高了2倍。
引用
@article{arxiv.2501.00274,
title = {LLM-Rubric: A Multidimensional, Calibrated Approach to Automated Evaluation of Natural Language Texts},
author = {Helia Hashemi and Jason Eisner and Corby Rosset and Benjamin Van Durme and Chris Kedzie},
journal= {arXiv preprint arXiv:2501.00274},
year = {2025}
}
备注
Updated version of 17 June 2024