中文

一种用于从RCT出版物中提取重叠PICO实体的基于片段模型

信息检索 2024-01-17 v1 人工智能 计算与语言

摘要

目的:PICO(人群、干预、对照、结局)实体的提取是证据检索的基础。我们提出了一种名为PICOX的新方法,用于提取重叠的PICO实体。材料与方法:PICOX首先通过评估一个词是否标记了实体的开始或结束来识别实体。然后,它使用一个多标签分类器为一个候选片段分配一个或多个PICO标签。使用一个性能最佳的基线模型EBM-NLP以及另外三个数据集(即PICO-Corpus,以及关于阿尔茨海默病或COVID-19的RCT出版物),采用实体级别的精确率、召回率和F1分数对PICOX进行了评估。结果:PICOX全面取得了优异的精确率、召回率和F1分数,微观F1分数从45.05提高到50.87(p << 0.01)。在PICO-Corpus上,PICOX获得了比基线更高的召回率和F1分数,并将微观召回率分数从56.66提高到67.33。在COVID-19数据集上,PICOX同样优于基线,并将微观F1分数从77.10提高到80.32。在AD数据集上,与基线相比,PICOX在精确率更高的情况下展示了相当的F1分数。结论:PICOX擅长识别重叠实体,并在多个数据集上持续超越一个领先的基线模型。消融研究表明,其数据增强策略有效地最小化了假阳性并提高了精确率。

关键词

引用

@article{arxiv.2401.06791,
  title  = {A Span-based Model for Extracting Overlapping PICO Entities from RCT Publications},
  author = {Gongbo Zhang and Yiliang Zhou and Yan Hu and Hua Xu and Chunhua Weng and Yifan Peng},
  journal= {arXiv preprint arXiv:2401.06791},
  year   = {2024}
}