论子词分词对低资源与高效命名实体识别的重要性:以马拉地语为例的案例研究
计算与语言
2023-12-05 v1 机器学习
摘要
命名实体识别(NER)系统在机器翻译、摘要和问答等 NLP 应用中发挥着至关重要的作用。这些系统用于识别命名实体,即涵盖位置、人物和组织机构等现实世界概念的对象。尽管针对英语的 NER 系统已有广泛研究,但它们在低资源语言背景下尚未得到充分重视。在这项工作中,我们聚焦于低资源语言的 NER,并展示了以印度语言马拉地语为背景的案例研究。NLP 研究的进步主要围绕利用 BERT 等预训练 Transformer 模型来开发 NER 模型。然而,我们通过结合两者的优势,专注于提升基于 CNN 和 LSTM 的浅层模型的性能。在 Transformer 时代,这些传统的深度学习模型因其高计算效率依然具有现实意义。我们提出了一种高效的混合 NER 方法,将基于 BERT 的子词分词器集成到基础 CNN/LSTM 模型中。我们展示了这种将传统基于词的分词器替换为 BERT 分词器的简单方法,使基础单层模型的准确率接近 BERT 等深度预训练模型。我们展示了使用子词分词对 NER 的重要性,并展示了我们为构建高效 NLP 系统所做的研究。评估在 L3Cube-MahaNER 数据集上进行,使用了来自 MahaBERT、MahaGPT、IndicBERT 和 mBERT 的分词器。
引用
@article{arxiv.2312.01306,
title = {On Significance of Subword tokenization for Low Resource and Efficient Named Entity Recognition: A case study in Marathi},
author = {Harsh Chaudhari and Anuja Patil and Dhanashree Lavekar and Pranav Khairnar and Raviraj Joshi and Sachin Pande},
journal= {arXiv preprint arXiv:2312.01306},
year = {2023}
}
备注
Accepted at ICDAM 2023