中文

LTP:一种基于CRF的命名实体识别新主动学习策略

计算与语言 2020-08-28 v2

摘要

近年来,深度学习在许多自然语言处理任务(包括命名实体识别)中取得了巨大成功。其不足在于通常需要大量人工标注数据。已有研究表明主动学习可精细地降低数据标注成本,但仍有很大改进空间。在实际应用我们中发现,现有基于不确定性的主动学习策略存在两点不足。首先,这些策略显式或隐式地偏好选择长序列,增加了标注人员的标注负担。其次,部分策略需侵入模型并修改以生成额外信息用于样本选择,这会增加开发人员工作量并增加模型的训练/预测时间。本文中,我们首先在BiLstm-CRF这一命名实体识别中广泛使用于若干典型数据集的特定案例中考察了传统主动学习策略。随后我们提出一种称为最低词元概率(Lowest Token Probability, LTP)的基于不确定性的主动学习策略,其结合CRF的输入与输出来选择信息量丰富的实例。LTP是一种简单而强大的策略,不偏好长序列且无需侵入模型。我们在多个数据集上测试了LTP,实验表明在句子级准确率和实体级F1-score上,LTP以明显更少的标注词元数略优于传统策略。相关代码已发布于 https://github.com/HIT-ICES/AL-NER

关键词

引用

@article{arxiv.2001.02524,
  title  = {LTP: A New Active Learning Strategy for CRF-Based Named Entity Recognition},
  author = {Mingyi Liu and Zhiying Tu and Tong Zhang and Tonghua Su and Zhongjie Wang},
  journal= {arXiv preprint arXiv:2001.02524},
  year   = {2020}
}