MOOCRep:一种统一的 MOOC 实体预训练嵌入方法
机器学习
2021-07-13 v1 人工智能
摘要
许多机器学习模型已被构建用于解决大规模开放在线课程(MOOC)平台上的信息过载问题。这些模型依赖于学习 MOOC 实体的强大表示。然而,它们受限于专家标注数据稀缺的问题。为克服该问题,我们提出利用 MOOC 结构中丰富的无标注数据来学习 MOOC 实体的预训练表示,这些表示可直接应用于下游任务。尽管现有预训练方法在 NLP 领域已取得成效,因为它们学习了强大的文本表示,但其模型未利用关于 MOOC 实体的更丰富信息。该更丰富信息包括讲座、概念与课程之间的图关系,以及关于概念复杂度的领域知识。我们开发了 MOOCRep,一种基于 Transformer 语言模型的新方法,通过两个预训练目标进行训练:1)基于图的目标,以捕获图中存在的实体与关系的强信号;2)面向领域的目标,以有效融入概念的复杂度级别。我们的实验表明,MOOCRep 的嵌入在两个对教育界重要的任务——概念先修预测与讲座推荐上,优于最先进的表示学习方法。
引用
@article{arxiv.2107.05154,
title = {MOOCRep: A Unified Pre-trained Embedding of MOOC Entities},
author = {Shalini Pandey and Jaideep Srivastava},
journal= {arXiv preprint arXiv:2107.05154},
year = {2021}
}