BanglaCoNER:面向鲁棒的孟加拉语复杂命名实体识别
计算与语言
2023-03-20 v2 人工智能
摘要
命名实体识别(NER)是自然语言处理中的一项基础任务,涉及对文本中命名实体的识别与分类。尽管孟加拉语是全球第七大使用语言,但针对孟加拉语复杂命名实体识别的研究却十分匮乏。CNER 比传统 NER 更具挑战性,因为它涉及识别和分类孟加拉语中不常见的复杂与复合实体。在本文中,我们展示了 Bangla 复杂命名实体识别挑战赛的获胜方案——使用两种不同方法在 BanglaCoNER 数据集上解决 CNER 任务,即条件随机场(CRF)和微调基于 transformer 的深度学习模型(如 BanglaBERT)。该数据集包含 15300 条训练句子和 800 条验证句子,采用 .conll 格式。对数据集的探索性数据分析(EDA)显示,数据集具有 7 种不同的 NER 标签,且英文单词出现显著,表明该数据集为合成数据,很可能是翻译的产物。我们尝试了多种特征组合,包括词性(POS)标签、词后缀、地名词典以及来自嵌入的聚类信息,同时也对 BanglaBERT(large)模型进行了 NER 微调。我们发现,并非所有语言模式都能被人立即察觉甚至直观理解,这正是基于深度学习的模型(包括 CNER 任务)在 NLP 中更为有效的原因。我们的微调 BanglaBERT(large)模型在验证集上取得了 0.79 的 F1 分数。总体而言,我们的研究凸显了孟加拉语复杂命名实体识别的重要性,尤其是在合成数据集的背景下。我们的发现也证明了 BanglaBERT 等深度学习模型在孟加拉语 NER 中的有效性。
引用
@article{arxiv.2303.09306,
title = {BanglaCoNER: Towards Robust Bangla Complex Named Entity Recognition},
author = {HAZ Sameen Shahgir and Ramisa Alam and Md. Zarif Ul Alam},
journal= {arXiv preprint arXiv:2303.09306},
year = {2023}
}
备注
Winning Solution for the Bangla Complex Named Entity Recognition Challenge