面向昆士兰采矿项目报告理解的专题建模方法研究
信息检索
2021-11-08 v1 机器学习
摘要
在采矿行业中,项目管理过程中会生成大量报告。这些历史文档是未来成功的宝贵知识资源。然而,若文档未经组织且非结构化,检索必要信息将繁琐而困难。文档聚类是应对该问题的有力方法,既往研究已提出多种方法。但不存在对任意类型文档均表现最佳的万能方法,因此需探索性研究以将聚类方法应用于新数据集。本研究将调查多种专题建模(TM)方法,目标是利用昆士兰政府资源部地质调查局的数据集找出适用于采矿项目报告的恰当方法,并理解其内容以获知如何组织它们。我们对隐狄利克雷分配(LDA)、非负矩阵分解(NMF)与非负张量分解(NTF)三种 TM 方法进行了统计与定性比较。评估后我们得出结论:LDA 对该数据集表现最佳,但其他方法经改进后仍有可能被采用。
引用
@article{arxiv.2111.03576,
title = {Investigation of Topic Modelling Methods for Understanding the Reports of the Mining Projects in Queensland},
author = {Yasuko Okamoto and Thirunavukarasu Balasubramaniam and Richi Nayak},
journal= {arXiv preprint arXiv:2111.03576},
year = {2021}
}
备注
Accepted in The 19th Australasian Data Mining Conference 2021