数学应用题中相关与不相关句子的联合概率分类模型
计算与语言
2014-11-24 v1 信息检索
机器学习
机器学习
摘要
估计数学应用题的难度水平是许多教育应用的一项重要任务。识别数学应用题中的相关与不相关句子是计算此类问题难度水平的重要步骤。本文探讨了文本分类的一个新颖应用,即识别数学应用题中的两类句子:相关句子和不相关句子。提出了一种新颖的联合概率分类模型,通过利用所有句子之间的相关性以及问句与其他句子及句子文本之间的相关性,来估计一个数学应用题中所有句子分类决策的联合概率。将该模型与 i) 一个仅使用句子文本对单个句子做出独立分类决策的 SVM 分类器,以及 ii) 一个考虑了问句与其他句子之间相关性以及句子文本的新颖 SVM 分类器进行了比较。大量实验证明了该联合概率分类模型以及利用了问句与其他句子之间相关性的新颖 SVM 分类器在识别相关与不相关句子方面的有效性。此外,实证结果和分析表明:i) 不去除停用词非常有益;ii) 利用词性标注并未带来显著改进,尽管它已被证明对相关的数学应用题类型分类任务有效。
引用
@article{arxiv.1411.5732,
title = {A Joint Probabilistic Classification Model of Relevant and Irrelevant Sentences in Mathematical Word Problems},
author = {Suleyman Cetintas and Luo Si and Yan Ping Xin and Dake Zhang and Joo Young Park and Ron Tzur},
journal= {arXiv preprint arXiv:1411.5732},
year = {2014}
}
备注
appears in Journal of Educational Data Mining (JEDM, 2010)