中文

基于生成式 AI 的稀疏多维学习绩效数据增强

机器学习 2025-01-07 v3 人工智能

摘要

学习绩效数据描述自适应学习中正确与错误答案或问题解决尝试的情况,例如在智能辅导系统(ITSs)中。由于自适应题目选择,学习绩效数据在大多数实际应用中 tend to be highly sparse(约 80%~90% 缺失观察),这给使用学习者模型有效预测未来绩效并探索关于学习的新假设带来了挑战。本文提出了一个系统化的数据增强框架,以解决学习绩效数据中的稀疏性问题。首先,将学习绩效表示为学习者、题目、答案和尝试次数的三维张量,捕捉学习过程中纵向知识状态。其次,采用张量分解方法对稀疏学习者数据张量中的缺失值进行插值,从而将插值置于基于知识追踪任务的框架内,即基于真实观察预测缺失绩效值。最后,引入生成学习模式的模块。本研究比较两种生成式人工智能(AI)形式,包括生成对抗网络(GAN)和生成式预训练变换器(GPT),用于生成与不同学习者数据簇相关联的数据。我们在为成人阅读理解(ARC)开发的 AutoTutor 课程中的成人识字数据集上测试了该方法。我们发现:(1)张量分解在不进行数据增强的其他知识追踪技术之外,显著提升了知识掌握的追踪与预测性能,显示出更高的相对忠实度;(2)基于 GAN 的仿真在样本数不断变化的情况下,整体稳定性更好,统计偏差更小,基于收敛评估与 GPT 相比表现更优。

关键词

引用

@article{arxiv.2409.15631,
  title  = {Data Augmentation for Sparse Multidimensional Learning Performance Data Using Generative AI},
  author = {Liang Zhang and Jionghao Lin and John Sabatini and Conrad Borchers and Daniel Weitekamp and Meng Cao and John Hollander and Xiangen Hu and Arthur C. Graesser},
  journal= {arXiv preprint arXiv:2409.15631},
  year   = {2025}
}