低资源领域的无监督命名实体消歧
计算与语言
2024-12-16 v1
摘要
在自然语言处理和信息检索的不断发展格局中,对鲁棒的领域特定实体链接算法的需求变得越来越明显。在人文学科、技术写作和生物医学科学等众多领域中,丰富文本语义并发现更多知识至关重要。在这些领域中使用命名实体消歧(NED)需要处理噪声文本、低资源设置和领域特定的知识库。现有方法大多不适合此类场景,因为它们要么依赖训练数据,要么不够灵活以与领域特定的知识库配合工作。因此,在本工作中,我们提出了一种利用 Group Steiner Trees(GST)概念的无监督方法,该方法可以通过文档中所有提及的候选实体之间的上下文相似性来识别最相关的消歧候选。我们在各种领域特定数据集上的 Precision@1 指标上,以超过 40%(平均)的优势超越了最先进的无监督方法。
引用
@article{arxiv.2412.10054,
title = {Unsupervised Named Entity Disambiguation for Low Resource Domains},
author = {Debarghya Datta and Soumajit Pramanik},
journal= {arXiv preprint arXiv:2412.10054},
year = {2024}
}
备注
Accepted in EMNLP-2024