中文

文本信息与等级响应数据的联合主题建模与因子分析

机器学习 2013-05-13 v2 机器学习

摘要

现代机器学习方法对于开发直接满足个体学习者需求的大规模个性化学习系统至关重要。最近开发的稀疏因子分析(SPARFA)框架为基于机器学习的学习分析提供了一种新的统计模型和算法,用于估计学习者对领域 underlying 潜在概念的掌握程度;同时也为内容分析提供算法,用于估计一组问题与潜在概念之间的关系。SPARFA 仅依据对一组问题的二值化等级响应来估计这些量。为了更好地解释估计出的潜在概念,SPARFA 依赖于一个后处理步骤,该步骤利用为每个问题提供的用户定义标签(例如主题或关键词)。在本文中,我们通过扩展 SPARFA 以联合处理学习者的等级响应以及每个问题及其相关答案或其他反馈的文本,从而放宽了对用户定义标签的需求。我们这种纯数据驱动的方法:(i) 无需显式生成一组标签或执行后处理步骤即可增强估计潜在概念的可解释性;(ii) 提高了 SPARFA 的预测性能;(iii) 可扩展至大型测试/评估场景,而在这些场景中人工标注将显得负担过重。我们在两个真实教育数据集上展示了所提方法的有效性。

关键词

引用

@article{arxiv.1305.1956,
  title  = {Joint Topic Modeling and Factor Analysis of Textual Information and Graded Response Data},
  author = {Andrew S. Lan and Christoph Studer and Andrew E. Waters and Richard G. Baraniuk},
  journal= {arXiv preprint arXiv:1305.1956},
  year   = {2013}
}