探索大语言模型在生物医学概念链接中的上下文学习能力
计算与语言
2023-07-04 v1 人工智能
摘要
生物医学领域在文献挖掘、图对齐、信息检索、问答、数据与知识整合等多个领域严重依赖概念链接。尽管大语言模型(LLMs)已在许多自然语言处理任务中取得重大进展,但其在生物医学概念映射中的有效性尚待充分探索。本研究探讨了一种利用大模型的上下文学习(ICL)能力进行生物医学概念链接的方法。所提方法采用两阶段检索与重排序框架。首先,使用语言模型对生物医学概念进行嵌入,然后利用嵌入相似度检索出前若干候选。随后将这些候选的上下文信息纳入提示(prompt)并由大语言模型处理以对概念重排序。该方法在 BC5CDR 疾病实体归一化中达到 90.% 的准确率,在化学实体归一化中达到 94.7%,展现出与监督学习方法相竞争的性能。此外,其在某肿瘤学匹配数据集上的 F1 分数绝对提升超过 20 点。我们进行了广泛的定性评估,并讨论了在生物医学领域使用大语言模型的益处与潜在不足。
引用
@article{arxiv.2307.01137,
title = {Exploring the In-context Learning Ability of Large Language Model for Biomedical Concept Linking},
author = {Qinyong Wang and Zhenxiang Gao and Rong Xu},
journal= {arXiv preprint arXiv:2307.01137},
year = {2023}
}