中文

QuesNet:面向异构测试题目的统一表示

机器学习 2019-05-28 v1 计算与语言 机器学习

摘要

理解学习材料(如测试题目)是在线学习系统中的关键问题,可促进教育领域的诸多应用。遗憾的是,许多监督方法受限于人工标注数据稀缺的问题,而大量未标注资源被严重低估利用。为缓解该问题,一种有效方案是使用预训练表示进行题目理解。然而,NLP 领域的现有预训练方法由于教育中的若干领域特定特征而无法学习测试题目表示。首先,题目通常由异构数据构成,包括内容文本、图像与侧信息。其次,其中既存在基础语言信息,也存在领域逻辑与知识。为此,本文提出一种新颖的预训练方法 QuesNet,用于全面学习题目表示。具体而言,我们首先设计一个统一框架,将题目信息与其异构输入聚合成一个综合向量。随后提出一种两级分层预训练算法,以无监督方式学习对测试题目的更好理解。其中,开发了新颖的掩蔽语言模型目标以提取底层语言特征,并提出领域导向目标以学习高层逻辑与知识。此外,我们展示了 QuesNet 在诸多基于题目的任务中具有良好的微调能力。我们在大规模真实题目数据上进行了广泛实验,实验结果清晰地证明了 QuesNet 在题目理解上的有效性及其优越的适用性。

关键词

引用

@article{arxiv.1905.10949,
  title  = {QuesNet: A Unified Representation for Heterogeneous Test Questions},
  author = {Yu Yin and Qi Liu and Zhenya Huang and Enhong Chen and Wei Tong and Shijin Wang and Yu Su},
  journal= {arXiv preprint arXiv:1905.10949},
  year   = {2019}
}