利用《摩诃婆罗多》语言模型计算估计相关词——一部印度史诗
计算与语言
2023-05-10 v1
摘要
《摩诃婆罗多》是众多印度文学作品中最广为人知的一部,其在诸多领域被以完全不同的目的所引用。该文本本身具有多个维度与方面,对人类的个人生活与职业生活皆有益处。这部印度史诗最初以梵文写成。在当今自然语言处理、人工智能、机器学习与人机交互的时代,该文本可按领域需求进行处理。处理此文本并从中获取有用洞见颇具趣味。人类在分析《摩诃婆罗多》时的局限在于,他们对作者叙述的故事始终带有情感倾向。除此之外,人类无法记忆统计或计算细节,例如哪两个词频繁共现于同一句中?整部文献中句子的平均长度是多少?哪个词是文本中最常见的词,各句中使用的词的词形还原形式是什么?因此,本文提出一种 NLP 流水线,以从这部最大的史诗《摩诃婆罗多》中获取若干统计与计算洞见,以及最相关词的搜索方法。我们堆叠了不同的文本处理方法以得出最佳结果,这些结果可进一步用于需要参考《摩诃婆罗多》的各种领域。
引用
@article{arxiv.2305.05420,
title = {Estimating related words computationally using language model from the Mahabharata -- an Indian epic},
author = {Vrunda Gadesha and Keyur D Joshi and Shefali Naik},
journal= {arXiv preprint arXiv:2305.05420},
year = {2023}
}
备注
ICT Analysis and Applications: Proceedings of ICT4SD 2022 pp 627-638