中文

生成-评估一致性:面向LLM驱动自适应评估的必要有效性准则

人工智能 2026-05-20 v1

摘要

当相同的LLM生成评估项目、模拟学生响应并对其进行评分时,验证环节是自指的。在两个阶段的自适应评估中,我们引入生成-评估一致性(GEA),这是一种衡量LLM评分函数是否恢复其生成函数所指令产生的技能水平的有效性准则。对GEA的第一次直接测量显示,该模型在恢复大约一半的预期方差r=0.698时存在系统性正偏差。GEA在语法可验证技能上表现良好(r>0.7),但在设计层面的技能上接近于零,低技能的过估计会导致在路由阈值附近的得分被高估。我们认为,细粒度的技能分解评分标准是加强GEA的主要提议机制,并概述了其他补充缓解措施。

关键词

引用

@article{arxiv.2605.19529,
  title  = {Generative-Evaluative Agreement: A Necessary Validity Criterion for LLM-Enabled Adaptive Assessment},
  author = {Grandee Lee and Yue Wang and Che Yee Lye and Luke Peh},
  journal= {arXiv preprint arXiv:2605.19529},
  year   = {2026}
}

备注

BEA 2026