中文

面向生物医学术语嵌入的层次化预训练

计算与语言 2023-07-04 v1 人工智能

摘要

电子健康记录(EHR)包含叙述性病历,提供有关患者医疗状况与管理的详尽细节。临床病历的自然语言处理(NLP)可将临床术语的观测频率用作下游应用(如临床决策与患者轨迹预测)的预测特征。然而,由于大量高度相似且相关的临床概念存在,更有效的建模策略是通过表示学习将临床术语表示为语义嵌入,并将低维嵌入用作预测建模的特征向量。为实现高效表示,利用生物医学知识图谱微调预训练语言模型,可能比仅使用标准语言模型为生物医学术语生成更好的嵌入。这些嵌入能有效区分同义对与无关对。然而,它们往往无法捕捉具有层次性本质的概念之间不同等级的相似度或关联度。为克服该局限,我们提出 HiPrBERT,一种在新编译的、包含各类生物医学术语层次结构的数据上训练的新型生物医学术语表示模型。我们修改了现有的对比损失函数以从这些层次中提取信息。数值实验表明,HiPrBERT 能有效从层次信息中学习成对距离,从而为进一步的生物医学应用生成信息丰富得多的嵌入。

关键词

引用

@article{arxiv.2307.00266,
  title  = {Hierarchical Pretraining for Biomedical Term Embeddings},
  author = {Bryan Cai and Sihang Zeng and Yucong Lin and Zheng Yuan and Doudou Zhou and Lu Tian},
  journal= {arXiv preprint arXiv:2307.00266},
  year   = {2023}
}