ProtoBERT-LoRA:针对免疫治疗研究识别的高效原型微调
计算与语言
2025-03-27 v1 信息检索
定量方法
摘要
识别基因组存储库(如 Gene Expression Omnibus, GEO)中的免疫检查点抑制剂 (ICI) 研究对于癌症研究至关重要,但由于语义模糊、极端类别不平衡以及资源有限环境中的标签数据稀缺,仍面临挑战。我们提出了 ProtoBERT-LoRA,一种混合框架,将 PubMedBERT 与原型网络和低秩适应 (LoRA) 结合,用于高效微调。该模型通过 episodes 原型训练强制嵌入具有可分离的类别特征,同时保留了生物医学领域知识。我们的数据集分为:训练集 (20 个阳性, 20 个阴性), 原型集 (10 个阳性, 10 个阴性), 验证集 (20 个阳性, 200 个阴性), 测试集 (71 个阳性, 765 个阴性)。在测试数据集上评估,ProtoBERT-LoRA 实现了 0.624 的 F1 分数(精确率: 0.481, 召回率: 0.887),超越基于规则的系统、机器学习基线和微调的 PubMedBERT。将其应用于 44,287 项未标记研究可减少 82% 的手动审查工作量。消融研究确认,原型与 LoRA 的组合相对于单独使用的 LoRA 提高了 29% 的性能。
关键词
引用
@article{arxiv.2503.20179,
title = {ProtoBERT-LoRA: Parameter-Efficient Prototypical Finetuning for Immunotherapy Study Identification},
author = {Shijia Zhang and Xiyu Ding and Kai Ding and Jacob Zhang and Kevin Galinsky and Mengrui Wang and Ryan P. Mayers and Zheyu Wang and Hadi Kharrazi},
journal= {arXiv preprint arXiv:2503.20179},
year = {2025}
}
备注
Submitted to AMIA 2025 Annual Symposium