中文

CCS Explorer:从临床队列研究中实现相关性预测、抽取式摘要与命名实体识别

计算与语言 2023-02-02 v2 人工智能 人机交互 信息检索 机器学习

摘要

临床队列研究(CCS),如随机临床试验,是已记录临床研究的丰富来源。理想情况下,临床专家会审查这些文章以进行探索性分析,范围从评估现有药物治疗新发疾病的疗效,到对新开发药物的首次测试。然而,在PubMed上,仅针对COVID-19这样一种流行疾病,每天就会发表超过100篇文章。因此,医生可能需要数天才能找到文章并提取相关信息。我们能否开发一个系统来更快地筛选这些长篇文献列表,并记录每篇文章的关键要点?在这项工作中,我们提出了CCS Explorer,一个用于CCS中句子相关性预测、抽取式摘要以及患者、结局和干预实体检测的端到端系统。CCS Explorer被封装在一个基于Web的图形用户界面中,用户可输入任何疾病名称。CCS Explorer随后根据后端自动生成的查询结果,从PubMed上的文章中提取并聚合所有相关信息。对于每个任务,CCS Explorer基于Transformer预训练语言表示模型并添加额外层进行微调。这些模型使用两个公开可用数据集进行评估。CCS Explorer在使用BioBERT进行句子相关性预测时获得了80.2%的召回率、0.843的AUC-ROC和88.3%的准确率,并在使用PubMedBERT进行患者、干预、结局检测(PIO)时实现了77.8%的平均Micro F1-Score。因此,CCS Explorer能够可靠地提取相关信息以总结文章,节省约 660×\sim \text{660}\times 的时间。

关键词

引用

@article{arxiv.2211.00201,
  title  = {CCS Explorer: Relevance Prediction, Extractive Summarization, and Named Entity Recognition from Clinical Cohort Studies},
  author = {Irfan Al-Hussaini and Davi Nakajima An and Albert J. Lee and Sarah Bi and Cassie S. Mitchell},
  journal= {arXiv preprint arXiv:2211.00201},
  year   = {2023}
}

备注

Accepted at IEEE BigData 2022