CardioEmbed:临床心脏病学专用文本嵌入
计算与语言
2025-11-17 v1 机器学习
摘要
生物医学文本嵌入主要是使用来自 PubMed 的研究文献开发的,而临床心脏病学实践严重依赖于程序性知识和来自综合心脏病学教科书中发现的专门术语。本研究实践之间的差距限制了现有嵌入模型在临床应用中的有效性。本文训练了 CardioEmbed,这是一个基于 Qwen3-Embedding-8B 的领域专用嵌入模型,采用对比学习在经筛选的七部综合心脏病学教科书语料库上训练,经去重后约为15万句。该模型采用 InfoNCE 损失函数并结合 batch 中的负样本, 在心脏特定语义检索任务上实现99.60%的检索准确率,较当前最先进的医学嵌入模型 MedTE 提升了15.94个百分点。在 MTEB 医学基准测试中,该模型在 BIOSSES 上获得 0.77 的斯皮尔曼系数,在 SciFact 上获得 0.61 的 NDCG@10,表明在相关生物医学领域具有竞争性能。领域专用训练在综合临床教科书上可实现近乎完美的心脏检索(99.60% Acc@1),显著优于 MedTE 提升了15.94个百分点。
引用
@article{arxiv.2511.10930,
title = {CardioEmbed: Domain-Specialized Text Embeddings for Clinical Cardiology},
author = {Richard J. Young and Alice M. Matthews},
journal= {arXiv preprint arXiv:2511.10930},
year = {2025}
}
备注
14 pages, 6 figures