通过对比学习优化用于命名实体识别的双编码器
计算与语言
2023-02-24 v2 人工智能
摘要
我们提出一种用于命名实体识别(NER)的双编码器框架,其应用对比学习将候选文本片段与实体类型映射至同一向量表示空间。先前工作主要将NER视为序列标注或片段分类。我们则将NER构建为表示学习问题,最大化实体提及与其类型向量表示间的相似度。这使得嵌套与扁平NER同样易于处理,并能更好地利用含噪自监督信号。该双编码器NER公式的一大挑战在于将非实体片段与实体提及分离。不同于多数先前方法将全部非实体片段显式标注为同一类 (),我们引入一种新颖的动态阈值损失。实验表明,我们的方法在有监督与远程监督设定下均表现良好,对嵌套与扁平NER皆然,并在通用领域(如ACE2004、ACE2005)与生物医学等高价值垂直领域(如GENIA、NCBI、BC5CDR、JNLPBA)的标准数据集上确立了新的state of the art。我们在github.com/microsoft/binder发布代码。
引用
@article{arxiv.2208.14565,
title = {Optimizing Bi-Encoder for Named Entity Recognition via Contrastive Learning},
author = {Sheng Zhang and Hao Cheng and Jianfeng Gao and Hoifung Poon},
journal= {arXiv preprint arXiv:2208.14565},
year = {2023}
}
备注
ICLR 2023