基于示范学习的机器阅读理解框架下少样本生物医学命名实体识别
计算与语言
2024-10-28 v2
摘要
尽管深度学习技术已取得显著成就,其常依赖大量人工标注数据,且在少样本场景下表现欠佳。本研究旨在设计一种策略,提升模型在少样本学习场景下识别生物医学实体的能力。通过将生物医学命名实体识别(BioNER)重定义为机器阅读理解(MRC)问题,我们提出一种基于示范学习的方法以应对少样本 BioNER,该方法涉及构建恰当的任务示范。在评估所提方法时,我们使用六个基准数据集(包括 BC4CHEMD、BC5CDR-Chemical、BC5CDR-Disease、NCBI-Disease、BC2GM 与 JNLPBA)将所提方法与现有先进方法进行比较。我们通过报告 25-shot 与 50-shot 学习实验的 F1 分数来考察模型效能。在 25-shot 学习中,我们观察到平均 F1 分数较基线方法提升 1.1%,在六个数据集上分别达到 61.7%、84.1%、69.1%、70.1%、50.6% 与 59.9%。在 50-shot 学习中,我们进一步将平均 F1 分数较基线方法提升 1.0%,分别达到 73.1%、86.8%、76.1%、75.6%、61.7% 与 65.4%。我们报告称,在少样本学习 BioNER 领域,基于 MRC 的语言模型比序列标注方法更擅长识别生物医学实体。此外,我们的 MRC 语言模型可成功与严重依赖大量标注数据可用性的全监督学习方法竞争。这些结果凸显了少样本 BioNER 方法未来进展的可能路径。
关键词
引用
@article{arxiv.2308.06454,
title = {Demonstration-based learning for few-shot biomedical named entity recognition under machine reading comprehension},
author = {Leilei Su and Jian Chen and Yifan Peng and Cong Sun},
journal= {arXiv preprint arXiv:2308.06454},
year = {2024}
}