AdaRubric:面向 LLM 智能体评估的任务自适应评分标准
人工智能
2026-05-12 v3 计算与语言
摘要
LLM 智能体轨迹的评估本质上是任务特定的:代码调试智能体应在正确性和错误处理方面受评,而非在流畅性或安全性方面受评。然而,主导范式——LLM 作为评判者——会对所有任务应用相同的静态评分维度,导致系统性误评。我们提出 AdaRubric 框架,实现:(i)通过 LLM 从任务描述生成任务特定的评分标准,(ii)以置信度加权的、按维度的逐步评估智能体轨迹,(iii)为偏好学习生成稠密奖励信号。三种可组合的过滤策略,包括可证明防止维度级质量掩蔽的 Novel DimensionAwareFilter,能产出高质量的 DPO 偏好对。在 WebArena、ToolBench 和 AgentBench 上,AdaRubric 实现的人类相关性达 Pearson r = 0.79(相较于最强基线提升 +0.15),且可靠性强(Krippendorff's alpha = 0.83)。基于 AdaRubric 生成的偏好对训练的 DPO 模型在任务成功率上相较于最佳基线提升 +6.8-8.5%。AdaRubric 还能零样本推广到未见领域(SWE-bench),并可无修改地扩展至多模态智能体(VisualWebArena、OSWorld)。我们的代码已公开:https://github.com/alphadl/AdaRubrics
引用
@article{arxiv.2603.21362,
title = {AdaRubric: Task-Adaptive Rubrics for Reliable LLM Agent Evaluation and Reward Learning},
author = {Liang Ding},
journal= {arXiv preprint arXiv:2603.21362},
year = {2026}
}
备注
KnowFM @ ACL 2026