在LLM作为评判者的难度评估中预测与人类评分者的分歧,无需使用生成时概率信号
计算与语言
2026-05-13 v1 计算机与社会
摘要
使用大语言模型(LLM)自动生成教育材料正变得越来越普遍,但为这些材料分配难度级别仍然需要大量的人力。因此,LLM作为评判者(LLM-as-a-Judge)引起了关注,然而与人类评分者的分歧仍然是一个主要挑战。我们提出了一种方法,用于预测哪些LLM生成的难度评级可能与人类评分者产生分歧,以便将这些案例送去重新评级。与先前的方法不同,我们的方法不依赖于生成时的概率信号,这些信号必须在评级生成期间收集,并且通常难以在不同LLM之间进行比较。相反,利用难度是一个有序尺度这一事实,我们使用一个独立的嵌入空间,例如ModernBERT,并基于评级集的几何一致性来识别分歧候选。在使用GPT-OSS-120B和Qwen3-235B-A22B进行的基于CEFR的英语句子难度评估实验中,结果表明,所提出的方法在预测与人类评分者的分歧方面取得了比基于概率的基线更高的AUC。
引用
@article{arxiv.2605.12422,
title = {Predicting Disagreement with Human Raters in LLM-as-a-Judge Difficulty Assessment without Using Generation-Time Probability Signals},
author = {Yo Ehara},
journal= {arXiv preprint arXiv:2605.12422},
year = {2026}
}
备注
Accepted to Educational Data Mining (EDM) 2026 (Poster/Demo Track)