中文

概念基准提升 LLM 形成性评估与数据合成

机器学习 2025-04-08 v1

摘要

STEM 主题的形成性评估旨在通过识别学生当前的理解情况,从而针对如何进一步促进学习。先前研究表明,当前生成式大语言模型(LLM)在对开放式问题的构造性回答进行评估时,其表现显著低于基于高质量标记数据的监督分类器。然而,我们展示了概念基准可以显著提升 LLM 性能,这缩小了 LLM 作为即插即用评估工具与需要大量训练数据的较小监督模型之间的差距。对于概念基准使 LLM 能够实现强大性能的数据集,我们展示,概念基准帮助相同的 LLM 为训练轻量级高性能监督模型生成高质量合成数据。我们的实验涵盖多个 STEM 学生响应数据集,标签质量各异,包括一个新建的真实世界数据集,其中包含一些 AI 辅助响应,这引入了额外的考虑因素。

关键词

引用

@article{arxiv.2504.03877,
  title  = {Concept-based Rubrics Improve LLM Formative Assessment and Data Synthesis},
  author = {Yuchen Wei and Dennis Pearl and Matthew Beckman and Rebecca J. Passonneau},
  journal= {arXiv preprint arXiv:2504.03877},
  year   = {2025}
}

备注

13 pages excluding references. 9 tables and 4 figures