中文

基于 Wasserstein 空间对比表示学习的学生写作自动编码

机器学习 2020-12-02 v2 计算与语言

摘要

言语数据的定性分析在学习科学中至关重要。然而其劳动密集且耗时,限制了研究者可纳入研究的数据量。本文致力于构建一种统计机器学习(ML)方法,以实现对学生写作定性分析的自动化支持,此处具体针对入门生物学实验报告中论证与推理复杂程度的评分。我们始于一组本科生物学课程实验报告,其采用考量论证结构复杂性、证据范围及结论审慎与细致程度的四级评分方案。利用这组标注数据,我们展示了一种流行的自然语言建模处理流程,即词向量表示(亦称词嵌入),继之以长短期记忆(LSTM)模型将语言生成作为状态空间模型捕获,在一种新颖对比学习设定下训练时,能够以高二次加权kappa(QWK)预测分数定量捕获该评分。我们表明该 ML 算法接近人类分析的评分者间信度。最终我们得出结论,用于自然语言处理(NLP)的机器学习(ML)有望协助学习科学研究者以远超当前可行的规模开展定性研究。

关键词

引用

@article{arxiv.2011.13384,
  title  = {Automatic coding of students' writing via Contrastive Representation Learning in the Wasserstein space},
  author = {Ruijie Jiang and Julia Gouvea and David Hammer and Eric Miller and Shuchin Aeron},
  journal= {arXiv preprint arXiv:2011.13384},
  year   = {2020}
}