中文

面向医学领域的嵌入模型域规范化

计算与语言 2025-08-07 v2

摘要

医学文本嵌入模型是广泛应用于医疗保健领域的基础技术,涵盖临床决策支持、生物医学信息检索和医学问答等应用,但仍面临两个关键不足之处:其一,大多数模型是在狭窄的医学和生物学数据上训练的,并且在方法学上不够前沿,难以捕捉实际应用中遇到的术语和语义的多样性;其二,现有评估往往不够充分,即便是广泛使用的基准测试也难以在医学各类真实任务的全谱系中得到概括。为此,我们利用MEDTE,这是一个在多样化医学语料库上通过自监督对比学习进行广泛微调的GTE模型,提供稳健的医学文本嵌入。同时,我们提出了包含51个任务的综合基准套件,涵盖分类、聚类、对分类和检索,基于Massive Text Embedding Benchmark(MTEB)但针对医学文本的特殊性进行调整。我们的结果表明,这种结合方法不仅构建了稳健的评估框架,而且产生的嵌入在不同任务中均显著优于现有SOTA方法。

关键词

引用

@article{arxiv.2507.19407,
  title  = {Towards Domain Specification of Embedding Models in Medicine},
  author = {Mohammad Khodadad and Ali Shiraee Kasmaee and Mahdi Astaraki and Hamidreza Mahyar},
  journal= {arXiv preprint arXiv:2507.19407},
  year   = {2025}
}