面向生物医学大语言模型训练的知识驱动智能科学语料蒸馏框架
计算与语言
2025-12-19 v3 人工智能
定量方法
摘要
为生物医学大语言模型 (LLM) 进行语料蒸馏旨在解决开源标注科学语料数量和质量不足的紧迫挑战, 这仍是生物医学研究中有效 LLM 训练的瓶颈。本文提出一种面向生物医学 LLM 训练的知识驱动、智能语料蒸馏框架, 以解决生物医学知识复杂层级结构所带来的挑战。本方法的核心是协作式多智能体架构, 其中由 Medical Subject Headings (MeSH) 层级指导的专用智能体协同工作, 自主从广阔科学文献中提取、综合和自我评估高质量文本数据。该智能体框架共同生成并精炼领域特定问答对, 确保全面覆盖与生物医学本体论的一致性, 同时最大程度减少人工介入。大量实验结果表明, 在我们的多智能体蒸馈数据集上训练的语言模型在生物医学问答任务上实现显著提升, 超越了强大的生命科学 LLM 基线以及先进的专有模型。值得注意的是, 我们的 AI-就绪数据集使 Llama3-70B 超越了 GPT-4 及其 MedPrompt 和 Med-PaLM-2。详细的消融研究和案例分析进一步验证了每个智能体在框架中的有效性与协同作用, 凸显了多智能体协作在生物医学 LLM 训练中的潜力。
引用
@article{arxiv.2504.19565,
title = {Knowledge-Driven Agentic Scientific Corpus Distillation Framework for Biomedical Large Language Models Training},
author = {Meng Xiao and Xunxin Cai and Qingqing Long and Chengrui Wang and Yuanchun Zhou and Hengshu Zhu},
journal= {arXiv preprint arXiv:2504.19565},
year = {2025}
}
备注
Biomedical Large Language Models, Agentic Corpus Distillation, Synthetic Question-Answer Generation, Agentic AI, Knowledge Hierarchy Guidance