深入规律性:一种简单而有效的汉语命名实体识别方法
计算与语言
2022-04-19 v2
摘要
近年来,汉语命名实体识别(NER)的性能提升得益于新框架的提出或词词典的引入。然而,字符级汉语 NER 中实体提及的内部构成却鲜有研究。实际上,大多数规则类型的提及具有强烈的命名规律性。例如,以“公司”或“银行”等指示词结尾的实体通常属于组织。本文中,我们提出一种简单而有效的探究汉语 NER 中实体跨度规律性的方法,称为规律性启发识别网络(RICON)。具体而言,所提模型由两条分支组成:规律性感知模块与规律性无关模块。规律性感知模块捕捉每个跨度的内部规律性以更好地预测实体类型,而规律性无关模块用于定位实体边界并缓解对跨度规律性的过度关注。进一步构建正交空间以鼓励两个模块提取不同方面的规律性特征。为验证方法有效性,我们在三个基准数据集和一个实际医疗数据集上进行了大量实验。实验结果表明,我们的 RICON 显著优于先前的最先进方法,包括各类基于词典的方法。
引用
@article{arxiv.2204.05544,
title = {Delving Deep into Regularity: A Simple but Effective Method for Chinese Named Entity Recognition},
author = {Yingjie Gu and Xiaoye Qu and Zhefeng Wang and Yi Zheng and Baoxing Huai and Nicholas Jing Yuan},
journal= {arXiv preprint arXiv:2204.05544},
year = {2022}
}
备注
Accepted at NAACL 2022 Findings