中文

探索大语言模型在生物医学概念链接中的上下文学习能力

计算与语言 2023-07-04 v1 人工智能

摘要

生物医学领域在文献挖掘、图对齐、信息检索、问答、数据与知识整合等多个领域严重依赖概念链接。尽管大语言模型(LLMs)已在许多自然语言处理任务中取得重大进展,但其在生物医学概念映射中的有效性尚待充分探索。本研究探讨了一种利用大模型的上下文学习(ICL)能力进行生物医学概念链接的方法。所提方法采用两阶段检索与重排序框架。首先,使用语言模型对生物医学概念进行嵌入,然后利用嵌入相似度检索出前若干候选。随后将这些候选的上下文信息纳入提示(prompt)并由大语言模型处理以对概念重排序。该方法在 BC5CDR 疾病实体归一化中达到 90.% 的准确率,在化学实体归一化中达到 94.7%,展现出与监督学习方法相竞争的性能。此外,其在某肿瘤学匹配数据集上的 F1 分数绝对提升超过 20 点。我们进行了广泛的定性评估,并讨论了在生物医学领域使用大语言模型的益处与潜在不足。

关键词

引用

@article{arxiv.2307.01137,
  title  = {Exploring the In-context Learning Ability of Large Language Model for Biomedical Concept Linking},
  author = {Qinyong Wang and Zhenxiang Gao and Rong Xu},
  journal= {arXiv preprint arXiv:2307.01137},
  year   = {2023}
}