在部分标注的命名实体识别语料上微调 BERT
计算与语言
2022-11-29 v1
摘要
大多数命名实体识别(NER)模型基于训练数据集被完全标注的假设运作。虽然这对于 CoNLL 2003 和 OntoNotes 等成熟数据集成立,但有时无法获得完整的数据集标注。例如,在为降低成本而选择性标注实体后,可能出现此类情况。本工作提出一种利用自监督和标签预处理在此类部分标注数据集上微调 BERT 的方法。我们的方法优于先前基于 LSTM 的标签预处理基线,显著提升了在标注较差数据集上的性能。我们证明,在仅标注了总实体 10% 的 CoNLL 2003 数据集上微调 RoBERTa 时,遵循我们的方法足以达到在相同数据集上以 50% 实体标注训练的基线的性能。
引用
@article{arxiv.2211.14360,
title = {Finetuning BERT on Partially Annotated NER Corpora},
author = {Viktor Scherbakov and Vladimir Mayorov},
journal= {arXiv preprint arXiv:2211.14360},
year = {2022}
}
备注
6 pages, to be published in Proceedings of ISP RAS Open Conference 2022