基于半结构化阿育吠陀文本的语义标注与查询框架
信息检索
2023-10-13 v1 计算与语言
摘要
知识库(KB)是许多自然语言处理(NLP)与信息检索(IR)任务(如语义搜索、自动问答等)的重要资源,对于试图从文本中获取信息的研究人员也很有用。然而,由于工具与方法尚不可用或精度不足,梵语NLP的当前技术水平尚无法实现知识库的自动构建。因此,在本工作中,我们描述了为构建知识图谱(KG)而对梵语文本进行人工标注的努力。我们选取阿育吠陀文本《Bhavaprakasha》中的《Bhavaprakashanighantu》一书的Dhanyavarga章节进行标注。所构建的知识图谱包含410个实体与764条关系。由于《Bhavaprakashanighantu》是一部描述不同物质各种性质的技术性词汇文本,我们开发了一套精细的本体来刻画文本中实体与关系类型的语义。为查询该知识图谱,我们设计了31个查询模板,覆盖大多数常见问句模式。对于人工标注与查询,我们对先前开发的Sangrahaka框架进行了定制。包括数据集在内的整个系统可从 https://sanskrit.iitk.ac.in/ayurveda/ 获取。我们希望通过人工标注与后续整理所构建的知识图谱,将有助于未来NLP工具的开发与测试,以及《Bhavaprakasanighantu》文本的研究。
引用
@article{arxiv.2202.00216,
title = {Semantic Annotation and Querying Framework based on Semi-structured Ayurvedic Text},
author = {Hrishikesh Terdalkar and Arnab Bhattacharya and Madhulika Dubey and Ramamurthy S and Bhavna Naneria Singh},
journal= {arXiv preprint arXiv:2202.00216},
year = {2023}
}
备注
19 pages including appendix