以正未标记学习在电商中自举命名实体识别
计算与语言
2020-05-25 v1
摘要
在电商等领域中的命名实体识别(NER)因缺乏标注数据集而属研究不足的问题。识别该领域中的新颖实体类型(如产品、组件与属性)因其语言复杂性及现有知识资源覆盖率低而具挑战性。为解决此问题,我们提出一种自举正未标记学习算法,其融合领域特定语言特征以快速高效地扩展种子词典。该模型在一项产品描述新颖数据集上取得平均 F1 分数 72.02%,较基线 BiLSTM 分类器提升 3.63%,尤其表现出更优的召回率(平均 4.96%)。
引用
@article{arxiv.2005.11075,
title = {Bootstrapping Named Entity Recognition in E-Commerce with Positive Unlabeled Learning},
author = {Hanchu Zhang and Leonhard Hennig and Christoph Alt and Changjian Hu and Yao Meng and Chao Wang},
journal= {arXiv preprint arXiv:2005.11075},
year = {2020}
}
备注
Accepted at ECNLP 3 (ACL 2020)