中文

基于小规模标注数据和大规模无标签数据的半监督学习用于细粒度PICO实体识别

计算与语言 2024-12-30 v1 人工智能

摘要

目标: 从临床试验文献中提取PICO元素(参与者、干预措施、比较方案及结果)对于临床证据的检索、评估和综合至关重要。现有方法不区分PICO实体的属性。本研究旨在开发一种命名实体识别(NER)模型,用于提取具有细粒度的PICO实体。材料与方法: 我们使用来自4个公开数据集的2511篇摘要构建PICO提及,开发了一种半监督方法以促进NER模型FinePICO的训练,该方法将有限的PICO实体标注数据与丰富的无标签数据相结合。对于评估,我们将整个数据集划分为两个子集: 一个包含标注数据的较小组和一个不包含标注数据的较大组。我们基于仅使用小规模标注子集训练的监督学习模型以及使用完全标注的整个数据集训练的监督学习模型的性能,分别建立了理论上的下界和上界性能界限。最后,我们在较小的标注子集和较大的初始未标注子集上评估了FinePICO。我们使用精确率、召回率和F1分数衡量FinePICO的性能。结果: 我们的方法在小规模标注样本上实现了精确率/召回率/F1分别为0.567/0.636/0.60,超过基线模型(F1: 0.437)超过16%。该模型显示出对不同PICO框架和其他语料库的通用性,在多种实验设置下均 consistently优于基准(p值<0.001)。结论: 本研究贡献了一种通用且有效的半监督方法,用于从大规模无标签数据和小规模标注数据中进行命名实体识别。它最初支持细粒度PICO提取。

关键词

引用

@article{arxiv.2412.19346,
  title  = {Semi-Supervised Learning from Small Annotated Data and Large Unlabeled Data for Fine-grained PICO Entity Recognition},
  author = {Fangyi Chen and Gongbo Zhang and Yilu Fang and Yifan Peng and Chunhua Weng},
  journal= {arXiv preprint arXiv:2412.19346},
  year   = {2024}
}