中文

基于 BERT 模型的科学命名实体识别迭代自动标注

计算与语言 2025-02-25 v1 人工智能

摘要

本文提出了一种用于科学命名实体识别 (SciNER) 的迭代方法,基于 BERT 模型。我们利用迁移学习对预训练模型进行微调,使用小规模但高质量的手动标注数据集。该过程通过使用微调后的模型对更大的数据集进行自动标注,然后进行额外的微调轮次来不断优化。我们评估了两类模型,dslim/bert-large-NER 和 bert-largecased,发现 bert-large-cased 在所有指标上均优于前者。我们的做法在预测准确率和 F1 分数方面取得了显著提升,尤其是针对较少出现的实体类别。未来工作可包括针对未标注数据进行微调,探索更强大的编码器如 RoBERTa,以及扩大手动标注的范围。该方法具有更广泛的 NLP 任务应用前景,尤其是在标注数据稀缺的场景中。

关键词

引用

@article{arxiv.2502.16312,
  title  = {Iterative Auto-Annotation for Scientific Named Entity Recognition Using BERT-Based Models},
  author = {Kartik Gupta},
  journal= {arXiv preprint arXiv:2502.16312},
  year   = {2025}
}

备注

9 pages