中文

PromptLink:利用大型语言模型进行跨源生物医学概念链接

信息检索 2024-05-14 v1 人工智能 计算与语言

摘要

链接(对齐)生物医学概念以跨越不同数据源实现各种集成分析具有重要意义,但由于概念命名约定的差异,这一任务颇具挑战性。已develop 各种策略来克服这一挑战,例如基于字符串匹配规则、手动制作的词汇表,以及基于机器学习模型的方法。然而,这些方法受限于生物医学先验知识有限,难以在有限的规则、词汇表或训练样本之外进行泛化。最近,大型语言模型(LLM)凭借其前所未有的丰富先验知识和强大的零样本预测能力,在 diverse biomedical NLP 任务中展现出令人瞩目的成果。然而,LLM 面临高成本、有限上下文长度和不可靠预测等问题。为此,我们提出了 PromptLink,一个新的生物医学概念链接框架,利用 LLM。它首先采用生物医学专用的预训练语言模型生成能适合 LLM 上下文窗口的候选概念。然后,它利用 LLM 通过两个阶段的提示进行概念链接,其中第一个阶段的提示旨在从 LLM 中引发用于概念链接任务的生物医学先验知识,第二个阶段的提示则强制 LLM 对其自身预测进行反思,以进一步提高其可靠性。我们在两个 EHR 数据集之间以及外部生物医学知识图谱上的概念链接任务的实证结果表明,PromptLink 的有效性。此外,PromptLink 是一个通用框架,不依赖于额外的先验知识、上下文或训练数据,使其非常适合用于各种类型数据源的概念链接。该源代码可在 https://github.com/constantjxyz/PromptLink 上获取。

关键词

引用

@article{arxiv.2405.07500,
  title  = {PromptLink: Leveraging Large Language Models for Cross-Source Biomedical Concept Linking},
  author = {Yuzhang Xie and Jiaying Lu and Joyce Ho and Fadi Nahab and Xiao Hu and Carl Yang},
  journal= {arXiv preprint arXiv:2405.07500},
  year   = {2024}
}