面向临床心脏病文本表示的 LoRA 适配嵌入模型比较分析
计算与语言
2025-11-26 v1 机器学习
摘要
领域特定文本嵌入对于临床自然语言处理至关重要,但目前缺乏跨模型架构的系统比较。本研究评估了十个通过低秩适应(LoRA)微调以适应心脏病场景的变换模型,这些模型基于源自权威医学教科书的 106,535 条心脏病文本配对进行微调。结果表明,编码器-only 架构,特别是 BioLinkBERT,相对于较大的解码器-based 模型在领域特定性能上(分离得分:0.510)具有优势,同时所需计算资源显著更少。我们的发现挑战了更大语言模型必然产生更好领域特定嵌入的假设,并为临床 NLP 系统开发提供了实用指导。所有模型、训练代码和评估数据集均公开可用,以支持医学信息学中可重复的研究。
关键词
引用
@article{arxiv.2511.19739,
title = {Comparative Analysis of LoRA-Adapted Embedding Models for Clinical Cardiology Text Representation},
author = {Richard J. Young and Alice M. Matthews},
journal= {arXiv preprint arXiv:2511.19739},
year = {2025}
}
备注
25 pages, 13 figures, 5 tables