TURNER:面向中文命名实体识别的基于不确定性的检索框架
计算与语言
2022-02-21 v1 人工智能
信息检索
摘要
由于汉字的歧义性以及词边界的缺失,中文命名实体识别(NER)是一项困难的任务。以往关于中文NER的工作侧重于基于词典的方法,以引入边界信息并减少预测过程中的未登录词(OOV)情况。然而,在特定领域获取并动态维护高质量词典的成本高昂,这促使我们利用更通用的知识资源,例如搜索引擎。在本文中,我们提出TURNER:面向中文NER的基于不确定性的检索框架。TURNER背后的思想是模仿人类行为:当遇到未知或不确定的实体时,我们频繁检索辅助知识作为帮助。为提高检索的效率与效果,我们首先提出两类不确定性采样方法,用于筛选输入文本中最具歧义性的实体级不确定成分。随后,知识融合模型通过结合检索到的知识对不确定样本重新预测。在四个基准数据集上的实验证明了TURNER的有效性。TURNER优于现有的基于词典的方法,并达到了新的SOTA。
引用
@article{arxiv.2202.09022,
title = {TURNER: The Uncertainty-based Retrieval Framework for Chinese NER},
author = {Zhichao Geng and Hang Yan and Zhangyue Yin and Chenxin An and Xipeng Qiu},
journal= {arXiv preprint arXiv:2202.09022},
year = {2022}
}