中文

亚洲宗教有何共性?一项无监督文本分析探索

计算与语言 2019-12-24 v1 机器学习 应用统计

摘要

各类宗教教义的主要来源是其圣典,这些圣典因地理区位或特定宗教诞生时间等不同因素而因宗教而异。尽管存在这些差异,圣典之间仍可能基于其向信徒传授的教义而具有相似性。本文试图利用文本挖掘技术发现这种相似性。我们使用由亚洲(道德经、佛教、瑜伽经、奥义书)与非亚洲(四部圣经文本)构成的语料库,探索基于原始文档词频矩阵(DTM)、归一化 DTM 的欧氏、曼哈顿、杰卡德与余弦等相似性度量的发现,这些度量揭示了基于用词习惯的相似性。我们基于 K-近邻(KNN)、支持向量机(SVM)与随机森林等监督学习算法在预测语料库中任一章节正确圣典上的准确率来衡量其性能。原始 DTM 欧氏距离的 K-均值聚类可视化显示,这些圣典之间存在一种相似性模式,其中奥义书与道德经是语料库中最相似的文本。

关键词

引用

@article{arxiv.1912.10847,
  title  = {What do Asian Religions Have in Common? An Unsupervised Text Analytics Exploration},
  author = {Preeti Sah and Ernest Fokoué},
  journal= {arXiv preprint arXiv:1912.10847},
  year   = {2019}
}

备注

18 pages, 22 figures