蒸馏闭源 LLM 知识以实现本地稳定且经济的生物医学实体链接
计算与语言
2025-05-27 v1 人工智能
摘要
生物医学实体链接旨在将非标准实体映射到知识库中的标准实体。传统的监督学习方法表现良好,但需要大量标注数据进行迁移,这限制了它们在低资源场景下的使用。大型语言模型(LLM),尤其是闭源 LLM,可以解决这些问题,但存在稳定性风险和高昂的经济成本:使用这些模型受到商业公司的限制,并且在处理大量数据时会带来显著的经济成本。为了解决这个问题,我们提出了“RPDR”框架,该框架结合了闭源 LLM 和开源 LLM,对由少量数据微调的检索器检索到的候选实体进行重排序。通过提示闭源 LLM 从未标注数据中生成训练数据,并微调开源 LLM 进行重排序,我们有效地将知识蒸馏到可以在本地部署的开源 LLM 中,从而避免了稳定性问题和高经济成本问题。我们在两个数据集上评估了 RPDR,包括一个真实世界数据集和一个涉及中文和英文两种语言的公开数据集。在训练数据量不足的情况下,RPDR 在 Aier 数据集和 Ask A Patient 数据集上分别实现了 0.019 和 0.036 的 Acc@1 提升。结果证明了所提出框架的优越性和泛化能力。
引用
@article{arxiv.2505.19722,
title = {Distilling Closed-Source LLM's Knowledge for Locally Stable and Economic Biomedical Entity Linking},
author = {Yihao Ai and Zhiyuan Ning and Weiwei Dai and Pengfei Wang and Yi Du and Wenjuan Cui and Kunpeng Liu and Yuanchun Zhou},
journal= {arXiv preprint arXiv:2505.19722},
year = {2025}
}
备注
Accepted by ICIC 2025