多数还是少数:面向命名实体识别的数据不平衡学习方法
计算与语言
2025-01-22 v3
摘要
数据不平衡在各种机器学习 (ML) 任务中提出了重大挑战,特别是在自然语言处理 (NLP) 中的命名实体识别 (NER) 中。NER表现出具有长尾分布的数据不平衡,包含众多少数类(即实体类)和单一多数类(即O类)。这种不平衡导致实体类被误分类为O类。为了解决这个问题,我们提出了一种简单有效的学习方法,称为多数或少数 学习。MoM学习将仅针对真实标签为多数类的样本计算出的损失纳入传统ML模型的损失中。在四个NER数据集(日语和英语)上的评估实验表明,MoM学习在不牺牲多数类性能的情况下提升了少数类的预测性能,并且比广为人知和最先进的方法更有效。我们还使用序列标注和机器阅读理解等NER中常用的框架评估了MoM学习。此外,MoM学习无论在何种语言或框架下都取得了一致的性能提升。
引用
@article{arxiv.2401.11431,
title = {Majority or Minority: Data Imbalance Learning Method for Named Entity Recognition},
author = {Sota Nemoto and Shunsuke Kitada and Hitoshi Iyatomi},
journal= {arXiv preprint arXiv:2401.11431},
year = {2025}
}
备注
8 pages, 2 figures, 7 tables. Accepted at IEEE Access on Dec. 20, 2024