中文

ReProCon:面向少样本生物医学命名实体识别的可扩展且高效资源方法

计算与语言 2025-08-26 v1

摘要

生物医学领域的命名实体识别 (NER) 面临数据稀缺和标签分布不平衡的挑战,尤其是针对细粒度实体类型。我们提出 ReProCon,一种新的少样本 NER 框架,融合多原型建模、余弦对比学习和 Reptile 元学习,以解决上述问题。通过为每个类别表示多个原型,ReProCon 捕捉语义变异性,如同义词和语境差异;余弦对比目标确保类别间的强大分离。Reptile 元更新使模型能够用极少数据快速适应。采用轻量级 fastText + BiLSTM 编码器,内存使用量大幅降低,ReProCon 的宏平均 F1 分数几乎达到 BERT 基准(约 99%)。在标签预算为 30% 时模型保持稳定,当类别数从 19 扩展到 50 时,F1 分数仅下降 7.8%,显著优于 SpanProto 和 CONTaiNER 等基准方法(分别出现 10% 至 32% 的 F1 分数下降)。消融研究突出显示多原型建模和对比学习在管理类别不平衡方面的重要性。尽管标签歧义性仍是挑战,但 ReProCon 在资源受限的场景中实现了最先进的性能,适用于生物医学应用。

关键词

引用

@article{arxiv.2508.16833,
  title  = {ReProCon: Scalable and Resource-Efficient Few-Shot Biomedical Named Entity Recognition},
  author = {Jeongkyun Yoo and Nela Riddle and Andrew Hoblitzell},
  journal= {arXiv preprint arXiv:2508.16833},
  year   = {2025}
}