基于学科训练并通过LSTM变分自编码器框架填补知识追踪数据
机器学习
2023-02-28 v1 人工智能
摘要
缺失数据问题对提升深度学习模型在{\em 知识追踪}(KT)问题中的性能与应用构成了巨大挑战。然而,文献中对此问题的理解尚显不足。在本工作中,为应对该挑战,我们采用基于学科的训练方法,按学生ID而非按行号划分(我们称之为非基于学科的训练)来拆分和填补数据。基于学科的训练的好处在于可保留每位学生的完整序列,从而实现高效训练。进一步,我们利用两种已有的深度生成框架,即变分自编码器(VAE)和纵向变分自编码器(LVAE)框架,并将LSTM核嵌入其中形成LSTM-VAE和LSTM-LVAE(简记为VAE和LVAE)模型以生成高质量数据。在LVAE中,训练一个高斯过程(GP)模型来解耦学科(即学生)描述信息(如年龄、性别)与隐空间之间的相关性。本文最后比较了在原始数据上训练与在由非基于学科模型VAE-NS及基于学科训练模型(即VAE和LVAE)生成的数据填补后数据上训练的性能。我们证明,来自LSTM-VAE和LSTM-LVAE的生成数据可将原始模型性能提升约50%。此外,若预测模型较小,原始模型仅需多10%的学生数据即可超越原始性能;若预测模型较大,借助我们所提框架则需多50%的数据。
引用
@article{arxiv.2302.12910,
title = {Imputing Knowledge Tracing Data with Subject-Based Training via LSTM Variational Autoencoders Frameworks},
author = {Jia Tracy Shen and Dongwon Lee},
journal= {arXiv preprint arXiv:2302.12910},
year = {2023}
}
备注
Accepted by AAAI2023 AI4ED Workshop