CONTaiNER:基于对比学习的少样本命名实体识别
计算与语言
2022-03-29 v2
摘要
少样本设定下的命名实体识别 (NER) 对于低资源领域的实体标注至关重要。现有方法仅从源领域学习类特定语义特征与中间表示。这影响了向未知目标领域的泛化能力,导致次优表现。为此,我们提出 CONTaiNER,一种新颖的对比学习技术,其为少样本 NER 优化 token 间分布距离。CONTaiNER 不优化类特定属性,而是优化基于高斯分布嵌入区分 token 类别的广义目标。这有效缓解了源自训练领域的过拟合问题。我们在若干传统测试领域(OntoNotes、CoNLL'03、WNUT '17、GUM)与一个新型大规模少样本 NER 数据集(Few-NERD)上的实验表明,平均而言,CONTaiNER 以 3%–13% 的绝对 F1 点数优于先前方法,同时展现出一致的性能趋势,即便在先前方法无法取得可观性能的困难场景中亦如此。
引用
@article{arxiv.2109.07589,
title = {CONTaiNER: Few-Shot Named Entity Recognition via Contrastive Learning},
author = {Sarkar Snigdha Sarathi Das and Arzoo Katiyar and Rebecca J. Passonneau and Rui Zhang},
journal= {arXiv preprint arXiv:2109.07589},
year = {2022}
}
备注
Accepted by ACL 2022 (Main Conference, Long Paper)