RubricRAG:基于领域知识检索生成评分标准以实现LLM评估的可解释性与可靠性
信息检索
2026-03-24 v1 人工智能
计算与语言
机器学习
摘要
大型语言模型(LLM)越来越多地被用于自动评估和训练,采用如 LLM-as-judge 等自动评分器输出标量分数或偏好。虽然便利,但这些方法常常缺乏透明性:单个分数很少解释答案是良好还是不良、遗漏了哪些要求或系统应如何改进。这种可解释性不足限制了其在模型开发、数据集构建和高风险部署中的实用性。基于评分标准的查询特定评估提供了更透明的替代方案,通过将质量分解为明确、可检查的标准。然而,手动设计高质量、查询特定的评分标准既费时又需要高度思考,不利于实际部署。虽然先前方法集中于生成用于自动下游评估的中间评分标准,但这些评分标准是否既可解释又有效对于人类用户而言尚不明确。本文研究 LLM 是否能生成与人类编写的评分标准相似且更有效的实例特定评分标准,同时提高识别优质响应的效果。通过在两个评分标准基准测试上进行系统性研究,并探讨多种 few-shot 和 post-training 策略,我们发现即插即用 LLM 生成的评分标准与人类编写的评分标准对齐性较差。我们提出一种简单策略,即 RubricRAG,通过在推理时检索与相关查询相关的评分标准中的领域知识。我们展示,RubricRAG 能生成更可解释的评分标准,既在与人类编写评分标准的相似性上,也在改进下游评估效果方面均表现出色。我们的结果凸显了可扩展、可解释评估通过自动化评分标准生成的挑战与前景。
引用
@article{arxiv.2603.20882,
title = {RubricRAG: Towards Interpretable and Reliable LLM Evaluation via Domain Knowledge Retrieval for Rubric Generation},
author = {Kaustubh D. Dhole and Eugene Agichtein},
journal= {arXiv preprint arXiv:2603.20882},
year = {2026}
}