基于文本挖掘的圣典间相似与差异发现
其他统计学
2021-02-09 v1
摘要
对圣典的细致考察可深入洞察人类心理、关于社会组织的不同观念以及真理与上帝等概念。为增进并深化我们对圣典的理解,对其进行比较与区分至关重要。为此,我们使用的数据集包含九部圣典。本工作处理《古兰经》、亚洲圣典《道德经》、佛教、《瑜伽经》和《奥义书》,以及《圣经》中的四卷书,即《箴言书》、《传道书》、《便西拉智训》和《智慧书》的区分。这些圣典基于自然语言处理 NLP 进行分析,以频率形式创建语料库的数学表示,称为文档-词项矩阵(DTM)。在此分析之后,应用如监督学习与无监督学习等机器学习方法进行分类。此处我们使用多项式朴素贝叶斯(MNB)、支持向量机(SVM)、随机森林(RF)和 K-近邻(KNN)。我们获得,在这些方法中 MNB 能够以约 85.84% 的准确率预测圣典的类别。
引用
@article{arxiv.2102.04421,
title = {A Text Mining Discovery of Similarities and Dissimilarities Among Sacred Scriptures},
author = {Younous Mofenjou Peuriekeu and Victoire Djimna Noyum and Cyrille Feudjio and Alkan Goktug and Ernest Fokoue},
journal= {arXiv preprint arXiv:2102.04421},
year = {2021}
}