中文

通过混合方法解码美国高等教育系统中的学位字母汤:数据库与文本挖掘

信息检索 2023-09-26 v1 机器学习

摘要

本文提出一种模型,用于预测全国学生信息交换所(NSC)学生追踪报告中表述模糊的高等教育学位授予层级(如学士、硕士等)。该模型为两个模块之混合。第一模块通过参照我们建立的、涵盖近 950 个美国高等教育者所用学位名称缩写的综合数据库,解析 NSC 报告中的相关缩写要素。第二模块为基于 CNN-BiLSTM 建模的特征分类与文本挖掘之组合,其前接若干重度预处理步骤。本文模型以四种不同分辨率的多标签数据集训练,在最为复杂的数据集上取得 97.83% 准确率。此种对学位层级的细致分类将深化对学生成功与流动建模模式的认识。迄今,除人工方法与简单文本解析逻辑外,尚无此类分类策略尝试。

关键词

引用

@article{arxiv.2309.13050,
  title  = {Decoding the Alphabet Soup of Degrees in the United States Postsecondary Education System Through Hybrid Method: Database and Text Mining},
  author = {Sahar Voghoei and James Byars and John A Miller and Khaled Rasheed and Hamid A Arabnia},
  journal= {arXiv preprint arXiv:2309.13050},
  year   = {2023}
}

备注

18 Pages, 8 figures