中文

面向临床心脏病文本表示的 LoRA 适配嵌入模型比较分析

计算与语言 2025-11-26 v1 机器学习

摘要

领域特定文本嵌入对于临床自然语言处理至关重要,但目前缺乏跨模型架构的系统比较。本研究评估了十个通过低秩适应(LoRA)微调以适应心脏病场景的变换模型,这些模型基于源自权威医学教科书的 106,535 条心脏病文本配对进行微调。结果表明,编码器-only 架构,特别是 BioLinkBERT,相对于较大的解码器-based 模型在领域特定性能上(分离得分:0.510)具有优势,同时所需计算资源显著更少。我们的发现挑战了更大语言模型必然产生更好领域特定嵌入的假设,并为临床 NLP 系统开发提供了实用指导。所有模型、训练代码和评估数据集均公开可用,以支持医学信息学中可重复的研究。

关键词

引用

@article{arxiv.2511.19739,
  title  = {Comparative Analysis of LoRA-Adapted Embedding Models for Clinical Cardiology Text Representation},
  author = {Richard J. Young and Alice M. Matthews},
  journal= {arXiv preprint arXiv:2511.19739},
  year   = {2025}
}

备注

25 pages, 13 figures, 5 tables