中文

大规模评估中数学项目内容标准的自动对齐:语言模型方法

计算与语言 2025-10-14 v2 机器学习

摘要

准确地将项目与内容标准对齐对于大规模评估的有效得分解释至关重要。本研究评估了三种用于将项目与四个领域和十九个技能标签对齐的自动化方法。首先,我们提取嵌入并训练了多种经典监督式机器学习模型,进一步研究了降维对模型性能的影响。其次,我们对八个 BERT 模型及其变体进行微调,用于领域和技能对齐。最后,我们探索了基于多数投票和堆叠多个元模型的集成学习。DeBERTa-v3-base 在领域对齐中实现了最高的加权平均 F1 分数 0.950,而 RoBERTa-large 在技能对齐中获得了最高的 F1 分数 0.869。集成模型未超过最佳语言模型。降维提升了基于嵌入的线性分类器性能,但不及语言模型。本研究展示了不同方法在自动化项目对齐到内容标准方面的应用。

关键词

引用

@article{arxiv.2510.05129,
  title  = {Automated Alignment of Math Items to Content Standards in Large-Scale Assessments Using Language Models},
  author = {Qingshu Xu and Hong Jiao and Tianyi Zhou and Ming Li and Nan Zhang and Sydney Peters and Yanbin Fu},
  journal= {arXiv preprint arXiv:2510.05129},
  year   = {2025}
}