中文

重新思考处理缺失实体标注的负采样

计算与语言 2022-02-28 v3

摘要

负采样在处理命名实体识别(NER)的缺失标注方面非常有效。我们的贡献之一是通过引入两个有洞察力的概念:误采样和不确定性,来分析其如何起作用。实证研究表明,低误采样率和高不确定性对于通过负采样实现有前景的性能都是必不可少的。基于命名实体的稀疏性,我们还在理论上推导了零误采样率概率的下界,该下界仅与句子长度相关。另一项贡献是一种自适应且加权的采样分布,通过我们先前的分析进一步改进了负采样。在合成数据集和标注良好的数据集(例如 CoNLL-2003)上的实验表明,我们提出的方法在 F1 分数和损失收敛方面有益于负采样。此外,具有改进负采样的模型在真实世界数据集(例如 EC)上取得了新的 SOTA 结果。

关键词

引用

@article{arxiv.2108.11607,
  title  = {Rethinking Negative Sampling for Handling Missing Entity Annotations},
  author = {Yangming Li and Lemao Liu and Shuming Shi},
  journal= {arXiv preprint arXiv:2108.11607},
  year   = {2022}
}

备注

A long paper accepted by ACL-2022