Mahāṇāma:文学实体发现与链接的独特测试平台
计算与语言
2025-09-25 v1
摘要
高词汇变化、模糊指代和长程依赖使文学文本中的实体解析特别具有挑战性。我们提出 Mahāṇāma,这是首个用于梵语端到端实体发现与链接(EDL)的大规模数据集,梵语是一种形态丰富且资源匮乏的语言。该数据集源自世界最长史诗《摩诃婆罗多》,包含超过 10.9 万个命名实体提及,映射到 5500 个唯一实体,并与英文知识库对齐以支持跨语言链接。Mahāṇāma 的复杂叙事结构,加上广泛的名称变化和歧义,对解析系统构成了重大挑战。我们的评估揭示,当在测试集的全局上下文中评估时,当前的共指和实体链接模型表现不佳。这些结果凸显了当前方法在如此复杂话语中解析实体的局限性。因此,Mahāṇāma 为推进实体解析,特别是在文学领域,提供了一个独特的基准。
引用
@article{arxiv.2509.19844,
title = {Mah\={a}n\={a}ma: A Unique Testbed for Literary Entity Discovery and Linking},
author = {Sujoy Sarkar and Gourav Sarkar and Manoj Balaji Jagadeeshan and Jivnesh Sandhan and Amrith Krishna and Pawan Goyal},
journal= {arXiv preprint arXiv:2509.19844},
year = {2025}
}
备注
Accepted to EMNLP 2025. This is the authors' version. The official version will appear in the ACL Anthology