中文

BioPars:面向医学 biomedical 文本挖掘的预训练生物医学大语言模型

计算与语言 2025-07-03 v2 人工智能 机器学习

摘要

大型语言模型(LLM)近期因其建模、提取和应用复杂生物信息的能力,在生命科学领域受到广泛关注。除了传统的聊天机器人用途外,这些系统正越来越多地用于 Bioinformatics 领域的复杂分析和问题解决。首先,我们引入 BIOPARS-BENCH,即来自超过 1 万篇科学文章、教科书和医学网站的数据集。还引入 BioParsQA 用于评估所提出的模型,包含 5,231 条波斯语医学问题与答案。随后本文提出 BioPars,一种旨在评估 LLM 三项核心能力的简洁且精准的度量方法:获取领域知识、解读与综合知识,以及正确依据证据。我们比较了 ChatGPT、Llama 和 Galactica,揭示了这些模型记忆和检索已学知识的能力,但也暴露了在回答高阶现实问题和细粒度推理方面的不足。这表明需进一步微调以提升 LLM 在 Bioinformatics 任务中的能力。据我们了解,BioPars 是首个应用于波斯语医学问答的 LLM 应用,尤其是生成长篇答案。对四个选取的医学 QA 数据集评估显示,BioPars 相较于对比方法取得显著成果。在 BioParsQA 上达到 ROUGE-L 分数 29.99,超越 GPT-4 1.0;BERTScore 为 90.87(采用 MMR 方法);MoverScore 和 BLEURT 分值也高于其他三款模型。该模型报告的 MoverScore 为 60.43,BLEURT 为 50.78。BioPars 仍在持续开发中,相关资源将通过以下 GitHub 仓库公开:https://github.com/amirap80/BioPars。

关键词

引用

@article{arxiv.2506.21567,
  title  = {BioPars: A Pretrained Biomedical Large Language Model for Persian Biomedical Text Mining},
  author = {Baqer M. Merzah and Tania Taami and Salman Asoudeh and Saeed Mirzaee and Amir reza Hossein pour and Amir Ali Bengari},
  journal= {arXiv preprint arXiv:2506.21567},
  year   = {2025}
}