从记忆到泛化:微调大型语言模型以实现生物医学术语到标识符的归一化
计算与语言
2025-10-23 v1
摘要
有效的生物医学数据整合依赖于自动化的术语归一化,即将自然语言生物医学术语映射到标准化标识符。这种术语到标识符的链接对于语义互操作性至关重要。大型语言模型(LLM)在此任务上展现出潜力,但在不同术语体系上的表现参差不齐。我们在多个生物医学本体上评估了记忆能力(训练术语性能)和泛化能力(验证术语性能)。对 Llama 3.1 8B 进行微调揭示了因术语体系而异的显著差异。GO 映射显示出强大的记忆能力提升(术语到标识符准确率提升高达 77%),而 HPO 的提升微乎其微。泛化仅发生在蛋白质-基因(GENE)映射上(提升 13.9%),而对 HPO 和 GO 的微调产生的迁移可忽略不计。基线准确率因模型规模而异,其中 GPT-4o 在所有术语体系上均优于两种 Llama 变体。嵌入分析显示,基因符号与蛋白质名称之间存在紧密的语义对齐,但 GO 或 HPO 的术语与标识符之间的对齐较弱,这与有限词汇化相一致。微调的成功取决于两个相互作用的因素:标识符流行度和词汇化。流行标识符在预训练期间更可能被遇到,从而增强了记忆能力。词汇化标识符(如基因符号)实现了语义泛化。相比之下,GO 和 HPO 中的任意标识符将模型限制于死记硬背式学习。这些发现提供了一个预测框架,用于判断微调何时能增强事实回忆,以及何时因标识符稀疏或非词汇化而失败。
引用
@article{arxiv.2510.19036,
title = {From Memorization to Generalization: Fine-Tuning Large Language Models for Biomedical Term-to-Identifier Normalization},
author = {Suswitha Pericharla and Daniel B. Hier and Tayo Obafemi-Ajayi},
journal= {arXiv preprint arXiv:2510.19036},
year = {2025}
}
备注
Submitted for publication to BMC BioData Mining