中文

使用主题建模与聚类分析不同地区的民间故事

计算与语言 2022-06-10 v1 计算机与社会

摘要

本文采用两种主要的自然语言处理技术——主题建模与聚类,来发现民间故事中的模式并揭示地区间的文化关联。具体而言,我们使用 Latent Dirichlet Allocation 与 BERTopic 提取反复出现的元素,并使用 K-means 聚类对民间故事分组。本文试图回答民间故事间的异同是什么,以及它们说明了什么文化问题。我们在此表明,民间故事间的共同趋势是家庭、食物、传统性别角色、神话人物与动物。此外,民间故事的主题因地理位置而异,不同地区的民间故事具有不同动物与环境。我们发现宗教人物与动物在所有文化中均为常见主题并不令人意外。然而,我们惊讶于欧洲与亚洲民间故事常成对出现。我们的结果展示了某些元素在世界各地文化中的普遍性。我们期望我们的工作能成为未来民间故事研究的资源,并作为使用自然语言处理分析特定领域文档的范例。此外,由于我们仅基于主题分析文档,在民间故事的结构、情感与人物方面可做更多工作。

关键词

引用

@article{arxiv.2206.04221,
  title  = {Analyzing Folktales of Different Regions Using Topic Modeling and Clustering},
  author = {Jacob Werzinsky and Zhiyan Zhong and Xuedan Zou},
  journal= {arXiv preprint arXiv:2206.04221},
  year   = {2022}
}

备注

5 pages, 2 figures