基于混淆矩阵的 LLM 自动评分 Rubric 优化
人工智能
2026-03-03 v1 计算与语言
摘要
准确且无歧义的指导方针是大语言模型(LLM)评分器的关键要素,但手动编写这些提示词往往并非最优,因为 LLM 可能误解专家指南或缺乏必要的领域特定信息。因此,该领域正逐步向自动化提示优化,以减少手动试错的负担。然而,现有框架通常将独立且非结构化的错误样本聚合到单个更新步骤中,导致“规则稀释”,即冲突的约束削弱了模型的评分逻辑。为此,我们提出一种名为混淆感知 Rubric 优化(Confusion-Aware Rubric Optimization,CARO)的新型框架,通过结构性地分离错误信号来提升准确性和计算效率。CARO 利用混淆矩阵将单一错误信号分解为离散模式,允许对特定误分类模式进行诊断和修复。通过综合主导错误模式的针对性“修补”措施,并采用多样性感知的选择机制,该框架可防止指导冲突,无需资源密集型的嵌套细化循环。在教师教育和 STEM 数据集上的经验评估表明,CARO 显著优于现有 SOTA 方法。这些结果表明,用手术式、模式特定的修复取代混合错误聚合,可显著提升自动化评估的可扩展性和精确度。
引用
@article{arxiv.2603.00451,
title = {Confusion-Aware Rubric Optimization for LLM-based Automated Grading},
author = {Yucheng Chu and Hang Li and Kaiqi Yang and Yasemin Copur-Gencturk and Joseph Krajcik and Namsoo Shin and Jiliang Tang},
journal= {arXiv preprint arXiv:2603.00451},
year = {2026}
}