基于大语言模型的癌症疫苗辅料名称识别
计算与语言
2025-02-17 v1 人工智能
计算机与社会
摘要
动机:疫苗辅料是一种被纳入疫苗中的化学物质,通过增强免疫反应来提高疫苗的疗效。从癌症疫苗研究中识别辅料名称对于进一步研究和提高免疫疗法具有重要意义。然而,由于生物医学文献的持续扩充,手动标注面临重大挑战。本研究探索了使用大语言模型(Large Language Models, LLMs)识别疫苗辅料名称的自动方法,具体包括生成式预训练转换器(GPT)和大语言模型元 AI(Llama)。方法:我们利用了两个数据集:来自 AdjuvareDB 的 97 条临床试验记录,以及标注了疫苗辅料全集(Vaccine Adjuvant Compendium, VAC)的 290 篇摘要。在零样本和少样本学习范式下,使用最高可达四个示例的提示词,应用 GPT-4o 和 Llama 3.2。输出经自动和人工验证,以确保准确性和一致性。结果:GPT-4o 在所有情形下实现了 100% 的精确率,尤其在包含干预因素时,召回率和 F1 分数显著提升。在 VAC 数据集上,GPT-4o 采用干预因素时获得最高 F1 分数为 77.32%,超越 Llama-3.2-3B 约 2%。在 AdjuvareDB 数据集上,GPT-4o 在三样本提示下达到 81.67% 的 F1 分数,显著高于 Llama-3.2-3B 最高 F1 分数 65.62%。结论:我们的发现表明,大语言模型在识别辅料名称方面表现出色,包括罕见的名称变体。本研究强调了大语言模型通过高效提取信息来推进癌症疫苗开发的潜力。未来工作旨在将该框架扩展到 various biomedical literature,并提高模型在不同疫苗和辅料上的可泛化性。
引用
@article{arxiv.2502.09659,
title = {Cancer Vaccine Adjuvant Name Recognition from Biomedical Literature using Large Language Models},
author = {Hasin Rehana and Jie Zheng and Leo Yeh and Benu Bansal and Nur Bengisu Çam and Christianah Jemiyo and Brett McGregor and Arzucan Özgür and Yongqun He and Junguk Hur},
journal= {arXiv preprint arXiv:2502.09659},
year = {2025}
}
备注
10 pages, 6 figures, 4 tables