基于平衡微调的 LLM 与生物医学知识对齐
机器学习
2026-05-05 v3 人工智能
摘要
工程化 LLM 以加速生命科学研究需要其与生物医学知识保持稳健的对齐。我们观察到,生物医学文本的不确定性结构与常规文本存在根本差异:密集的低置信度段落编码的是表征知识缺口的因果链条和稀有实体,而非常规文本中稀疏的 aleatoric 风格变异。基于此发现,我们提出了平衡微调 (BFT),这是一种双尺度后训练方法,结合基于群归一化的 token 重权及面向表征知识稠密样本、显示密集认知不确定性的序列级再分配。BFT 在医学评估、生物推理、稀疏奖励强化学习以及生物表示任务上,均优于 SFT 和 DFT,在统一的训练设置下实现更持久的提升。当将 BFT 对齐的 70B 模型替代 GeneAgent (GPT-4o) 和 VCWorld (Gemini-2.5-Flash) 中的默认闭源底层模型时,该模型在生物过程推理和化学扰动预测方面表现更佳。关键在于,所有 BFT 变体在后续使用稀疏奖励的 GRPO 后仍进步,而 SFT 和 DFT 则退化,表明认知感知的后训练提供了更稳健的策略初始化。除文本生成外,BFT 对齐的 LLM 还能生成更准确、更专业的生物医学概要文本;将这些概要文本编码为文本嵌入后,所得表示支持基因级、细胞级及扰动-响应任务,表明 BFT 增强的生成可促进生物表示,并由此支持更广泛的生物医学下游任务。
引用
@article{arxiv.2511.21075,
title = {Aligning LLMs with Biomedical Knowledge using Balanced Fine-Tuning},
author = {Zhenchao Tang and Fang Wang and Haohuai He and Jiale Zhou and Tianxu Lv and Jun Zhu and Shouzhi Chen and Minghao Yang and Yu Wang and Jiayang Wu and Yidong Song and Yaokun Li and Jiehui Huang and Bing He and Jianhua Yao},
journal= {arXiv preprint arXiv:2511.21075},
year = {2026}
}