分析资助申请的流水线
机器学习
2022-11-01 v1 信息检索
摘要
数据挖掘技术能够将海量非结构化数据转化为定量数据,从而快速揭示原始数据背后的洞见、趋势与模式。本文将一个数据挖掘模型应用于分析提交给某澳大利亚政府科研资助机构的 2019 年资助申请,以考察资助计划是否如预期那样成功识别出创新性项目提案。这些资助申请为同行评审的研究提案,包含评审人指定的具体“创新与创造性”(IC)分数。除预测每份研究提案的 IC 分数外,我们特别感兴趣于理解创新性提案的用词特征。为解决该问题,研究并探索了多种数据挖掘模型与特征编码算法。最终,我们提出了性能最佳的模型:以表示 unigram 出现与否的特征编码文档上的随机森林(RF)分类器。具体而言,unigram 词项由改进的词频-逆文档频率(TF-IDF)算法编码,该算法仅实现 TF-IDF 的 IDF 部分。除所提模型外,本文还呈现了用于分析资助申请的严谨实验流水线,实验结果证明了其可行性。
引用
@article{arxiv.2210.16843,
title = {A Pipeline for Analysing Grant Applications},
author = {Shuaiqun Pan and Sergio J. Rodríguez Méndez and Kerry Taylor},
journal= {arXiv preprint arXiv:2210.16843},
year = {2022}
}