从评分细则到可靠分数:基于大语言模型评判器的证据落地文本评估
计算与语言
2026-05-29 v2 人工智能
机器学习
摘要
基于评分细则的文本评估越来越普遍地使用大语言模型(LLM)作为可扩展的评判器,但将冻结的黑盒模型与人类评分标准对齐仍然具有挑战性。我们将这一挑战形式化为一个准则迁移问题:目标不仅是提示 LLM 分配一个分数,而是将人类评分细则的意图转化为一个稳定、可审计且与人类对齐的评分协议。我们识别出基于 LLM 的评分细则评估中反复出现的三个失效模式:评分细则执行漂移、不可验证的分数归因以及与人类尺度的错位。为了解决这些失效模式,我们提出了 Rulers,一个用于可靠的、证据落地的基于评分细则文本评估的三阶段推理时框架。Rulers 首先将人类评分细则转化为锁定的任务级规范,然后通过结构化清单决策、类型化证据落地以及适用时的抽取式引文验证来执行该规范,最后应用事后校准,将模型导出的信号与人类分数边界对齐。在涵盖作文评分、摘要评估、英语作为外语写作评估和结构化输入文本生成的四个基于评分细则的基准测试中,Rulers 在多个冻结骨干模型的大多数评估设置下取得了更强的人类评分一致性。进一步分析表明,Rulers 能更好地匹配经验性人类分数分布,提高了在语义等价的评分细则扰动下的稳定性,并受益于其三个组件的每一个。这些结果表明,可靠的 LLM 评判需要固定的准则、可追溯的证据和校准过的分数解释,而不仅仅是提示措辞。我们的代码可在 https://anonymous.4open.science/r/Rulers_0525-3328 获取。
引用
@article{arxiv.2601.08654,
title = {From Rubrics to Reliable Scores: Evidence-Grounded Text Evaluation with LLM Judges},
author = {Yihan Hong and Huaiyuan Yao and Bolin Shen and Wanpeng Xu and Hua Wei and Yushun Dong},
journal= {arXiv preprint arXiv:2601.08654},
year = {2026}
}