基于地名录增强的孟加拉语命名实体识别:融合 BanglaBERT 语义嵌入与 K-Means 的 CRF 模型
计算与语言
2024-01-31 v1
摘要
命名实体识别(NER)是自然语言处理(NLP)的一个子任务,旨在将非结构化文本中的实体区分为预定义的类别。近年来,许多孟加拉语 NLP 子任务受到了相当多的关注;但孟加拉语的命名实体识别仍然滞后。在本研究中,我们探索了孟加拉语命名实体识别的现有研究现状。我们试图找出当前技术和数据集面临的局限性,并希望在我们的研究中解决这些局限性。此外,我们开发了一个地名录,它能够显著提升 NER 的性能。我们还通过利用超越传统技术的最先进的 NLP 工具,提出了一种新的 NER 解决方案。
引用
@article{arxiv.2401.17206,
title = {Gazetteer-Enhanced Bangla Named Entity Recognition with BanglaBERT Semantic Embeddings K-Means-Infused CRF Model},
author = {Niloy Farhan and Saman Sarker Joy and Tafseer Binte Mannan and Farig Sadeque},
journal= {arXiv preprint arXiv:2401.17206},
year = {2024}
}