中文

利用语言模型分析教育中的纵向经验数据

机器学习 2025-03-31 v1 计算机与社会

摘要

我们提出了一种新颖的方法,用于利用预训练语言模型(LM)来预测 STEM 学生的学术轨迹,这些数据捕捉了学生的学习相关活动、行为和心理状态,为基于预测的干预提供了宝贵的见解。处理此类数据面临的关键挑战包括高比例的缺失值、由于数据收集成本昂贵而导致的数据集大小有限,以及跨模态的复杂时间变异性。我们的 method 通过全面的数据丰富过程来解决这些问题,集成了管理缺失值、数据增强以及嵌入任务特定指令和情境线索的策略,以增强模型学习时间模式的能力。在针对精选的学生学习数据集进行的大量实验中,我们评估了 encoder-decoder 和 decoder-only LM。虽然我们的发现表明 LM 有效地整合了跨模态数据并对缺失数据具有鲁棒性,但它们主要依赖于高层次统计模式,而不显示对时间动态的更深层次理解。此外,它们解释明确时间信息的能力有限。这项工作推进了教育数据科学,突显了 LM 在建模基于纵向经验数据的学生轨迹以进行早期干预方面的潜力与局限性。

关键词

引用

@article{arxiv.2503.21617,
  title  = {Leveraging Language Models for Analyzing Longitudinal Experiential Data in Education},
  author = {Ahatsham Hayat and Bilal Khan and Mohammad Rashedul Hasan},
  journal= {arXiv preprint arXiv:2503.21617},
  year   = {2025}
}