中文

映射赞美诗并组织�vana的概念:定量连接�vana赞美

计算与语言 2025-03-25 v1

摘要

获取和洞察�vana赞美诗poses a non-trivial 挑战 due to its extremely ancient Sanskrit language, poetic structure, and large volume of text。通过使用 NLP 技术,本研究识别了赞美诗中主题和语义联系,这些联系被证实与七个著名的赞美诗分组相符。对 Jamison 和 Brereton 现代英译版的�vana赞美诗进行预处理,获取 1028 篇赞美诗的 sukta-level embeddings,分别采用 i) 本文中提出的 LSA 新型适应方法、ii) SBERT、iii) Doc2Vec 嵌入。随后对向量进行 UMAP 降维,使用 k-最近邻构建 sukta 网络。然后使用 Louvain、Leiden 和标签传播方法对 sukta 网络中的主题进行社区检测,其形成的主题统计显著性通过合适的零分布来确定。只有使用 Leiden 方法的 LSA 新型适应方法,检测到了显著(z = 2.726, p < .01)的 sukta 主题网络,其模块度得分为 0.944。在分析的七个著名赞美诗分组(如创世、丧葬、水等)中,LSA 派生的网络成功地在所有七个案例中检测到了相关 sukta,而 Doc2Vec 则不显著且未能检测到相关 sukta。SBERT 检测到四个著名赞美诗作为独立组,但错误地将三个赞美诗合并到单个混合组中。此外,SBERT 网络未达统计显著性。

关键词

引用

@article{arxiv.2503.18226,
  title  = {Mapping Hymns and Organizing Concepts in the Rigveda: Quantitatively Connecting the Vedic Suktas},
  author = {Venkatesh Bollineni and Igor Crk and Eren Gultepe},
  journal= {arXiv preprint arXiv:2503.18226},
  year   = {2025}
}

备注

Accepted to NLP4DH 2025 at NAACL 2025