中文

语境至关重要:面向科学教育语言模型的预训练策略

人工智能 2023-11-21 v1

摘要

本研究旨在提升科学教育中对学生作答自动评分的性能。基于 BERT 的语言模型已在多种语言相关任务中展现出相对于传统 NLP 模型的显著优越性。然而,学生撰写的科学文本(包括论证与解释)具有领域特异性。此外,学生使用的语言不同于期刊与 Wikipedia 中的语言,而后者是 BERT 及其现有变体的训练来源。这些都表明,使用科学教育数据预训练的领域特定模型或可提升模型性能。然而,用以语境化预训练语言模型并改善学生书面作答自动评分性能的 ideal 数据类型仍不明确。因此,本研究采用不同数据对 BERT 与 SciBERT 模型进行语境化,并比较它们在科学论证评估任务自动评分上的表现。我们使用三个数据集预训练模型:1)科学教育期刊文章,2)大规模学生书面作答数据集(样本量超 50,000),以及 3)小规模科学论证任务学生书面作答数据集。实验结果表明,由科学问题与作答构建的域内训练语料可提升语言模型在多种下游任务上的性能。我们的研究证实了在教育领域对领域特定数据持续预训练的有效性,并展示了一种可推广的、以高精度自动化科学教育任务的策略。我们计划发布我们的数据与 SciEdBERT 模型以供公众使用与社区参与。

关键词

引用

@article{arxiv.2301.12031,
  title  = {Context Matters: A Strategy to Pre-train Language Model for Science Education},
  author = {Zhengliang Liu and Xinyu He and Lei Liu and Tianming Liu and Xiaoming Zhai},
  journal= {arXiv preprint arXiv:2301.12031},
  year   = {2023}
}