中文

myNER:基于双向 LSTM 与 fastText 嵌入通过联合训练 POS 标记实现的上下文化缅甸语命名实体识别

计算与语言 2025-04-08 v1

摘要

命名实体识别 (NER) 涉及识别和分类文本数据中的命名实体。尽管其重要性已久,但 NER 研究往往忽视了像缅甸语 (Burmese) 等低资源语言,主要由于缺乏公开可用的标注数据集。为此,我们引入 myNER,一个新颖的词级别 NER 语料库,采用 7 标签标注方案,并辅以词性标记 (POS) tagging 以提供额外的句法信息。我们还在不同设置下对 NER 模型进行全面评估,包括条件随机场 (CRF)、双向 LSTM (BiLSTM)-CRF 以及它们与 fastText 嵌入的组合。我们的实验揭示了上下文化词嵌入的有效性以及联合训练 POS 标记的影响,显示不同模型均实现了显著的性能提升。传统的 CRF 联合任务模型配合 fastText 嵌入作为特征,达到了 0.9818 的准确率和 0.9811 的加权 F1 分数(宏 F1 为 0.7429)。BiLSTM-CRF 采用微调后的 fastText 嵌入的最佳结果为 0.9791 的准确率和 0.9776 的加权 F1 分数(宏 F1 为 0.7395)。

关键词

引用

@article{arxiv.2504.04038,
  title  = {myNER: Contextualized Burmese Named Entity Recognition with Bidirectional LSTM and fastText Embeddings via Joint Training with POS Tagging},
  author = {Kaung Lwin Thant and Kwankamol Nongpong and Ye Kyaw Thu and Thura Aung and Khaing Hsu Wai and Thazin Myint Oo},
  journal= {arXiv preprint arXiv:2504.04038},
  year   = {2025}
}

备注

7 pages, 2 figures, 5 tables, to be published in the proceedings of IEEE ICCI-2025