中文

构建医疗保健语言模型嵌入空间

计算与语言 2024-04-01 v1 人工智能

摘要

预训练大型语言模型(LLM)在诸如医疗保健相关文本等域外数据集上常常表现不佳。我们探索了专门的预训练,以使较小的LLM适应不同的医疗保健数据集。评估了三种方法:传统的掩码语言建模、用于无监督文本表示的深度对比学习(DeCLUTR),以及一种利用医疗保健环境中元数据类别的新颖预训练目标。这些方案在每个数据集的下游文档分类任务上进行了评估,并对生成的嵌入空间进行了额外分析。对比训练的模型在分类任务上优于其他方法,在有限的标注数据下表现出色,且所需的模型参数更新更少。虽然基于元数据的预训练并未进一步提高各数据集的分类性能,但它产生了有趣的嵌入簇可分性。所有领域适应的LLM均优于其公开可用的通用基础LLM,验证了领域专业化的重要性。本研究阐明了即使在计算预算紧张的情况下,将医疗保健能力注入紧凑LLM的有效方法,这是在本地医疗环境中负责任且可持续部署的必要能力。我们提供了专门医疗保健LLM的预训练指南,激发了对对比目标的持续探究,并展示了使小型LLM适应隐私敏感医疗任务的技术。

关键词

引用

@article{arxiv.2403.19802,
  title  = {Developing Healthcare Language Model Embedding Spaces},
  author = {Niall Taylor and Dan Schofield and Andrey Kormilitzin and Dan W Joyce and Alejo Nevado-Holgado},
  journal= {arXiv preprint arXiv:2403.19802},
  year   = {2024}
}