中文

TriNER:面向印度三大语言的命名实体识别模型系列

计算与语言 2025-02-07 v1 人工智能 机器学习

摘要

印度的丰富文化和语言多样性在自然语言处理(NLP)领域带来诸多挑战,尤其是命名实体识别(NER)。NER 是一种旨在识别并将标记分类为不同实体组(如人物、地点、组织、数字等)的 NLP 任务。这使得 NER 对下游任务如上下文感知匿名化非常有用。本文详细介绍了我们为印度三大语言——印地语、孟加拉语和马拉拉语构建多语言 NER 模型的工作。我们训练了自定义转换模型并微调了几个预训练模型,实现了 92.11 的 F1 分数,覆盖 6 个实体组。通过本文,我们旨在引入单一模型执行 NER 并显著减少跨三种语言实体组和标签名称的不一致性。

关键词

引用

@article{arxiv.2502.04245,
  title  = {TriNER: A Series of Named Entity Recognition Models For Hindi, Bengali & Marathi},
  author = {Mohammed Amaan Dhamaskar and Rasika Ransing},
  journal= {arXiv preprint arXiv:2502.04245},
  year   = {2025}
}