中文

基于医学实体丰富的预训练语言模型与多实例学习的 EQ-5D 分类

计算与语言 2026-02-26 v1 人工智能

摘要

EQ-5D (EuroQol 5-Dimensions) 是评估健康相关生活质量的标准仪器。在健康经济学中,系统文献综述 (SLR) 依赖于正确识别使用 EQ-5D 的文献,但手动筛选大量科学文献的工作耗时、易出错且不一致。本研究探讨了对通用预训练语言模型 (BERT) 和领域特定模型 (SciBERT、BioBERT) 的微调,这些模型通过 scispaCy 提取的医学实体信息丰富化,以提高从摘要中检测 EQ-5D 的准确性。我们进行了九套实验设置,包括将三个 scispaCy 模型与三个预训练模型组合,并在句子和研究两个层面进行评估。此外,我们探索了使用注意力池化的多实例学习 (MIL) 方法,以聚合句子级信息以生成研究级预测,其中每个摘要表示为由 scispaCy 丰富后的句子组成的袋子。研究结果表明,F1 分数稳定提升(达到 0.82),在研究层面几乎实现完美召回,显著优于经典的词袋基线和最近报告的预训练语言模型基线。这些结果表明,实体丰富显著提高了领域适应性和模型泛化能力,使自动化筛选在系统综述中更加准确。

关键词

引用

@article{arxiv.2602.21216,
  title  = {EQ-5D Classification Using Biomedical Entity-Enriched Pre-trained Language Models and Multiple Instance Learning},
  author = {Zhyar Rzgar K Rostam and Gábor Kertész},
  journal= {arXiv preprint arXiv:2602.21216},
  year   = {2026}
}

备注

12 tables