中文

面向生物医学情境学习的 MMRAG:多模式检索增强生成

计算与语言 2025-02-25 v1 人工智能

摘要

目标:通过改进例选取优化生物医学自然语言处理中的情境学习。在方法方面,我们引入一种新型多模式检索增强生成 (MMRAG) 框架,集成四种检索策略:(1) 随机模式,随机选取示例;(2) 顶部模式,基于相似度检索最相关的示例;(3) 多样性模式,确保所选示例的差异性;(4) 类别模式,选择类别代表性示例。该研究在三个核心生物医学 NLP 任务上评估了 MMRAG:命名实体识别 (NER)、关系抽取 (RE) 和文本分类 (TC)。使用的数据集包括 BC2GM(NER,用于基因和蛋白质指称识别)、DDI(RE,用于药物-药物相互作用抽取)、GIT(RE,用于一般生物医学信息抽取)和 HealthAdvice(TC,用于健康相关文本分类)。在两种大型语言模型 (Llama2-7B、Llama3-8B) 和三种检索器 (Contriever、MedCPT、BGE-Large) 上进行测试,以评估不同检索策略的性能。结果表明,随机模式的结果表明,提供更多示例可提高模型的生成性能。同时,顶部模式和多样性模式在 RE (DDI) 任务上显著优于随机模式,F1 分数达到0.9669,提升26.4%。在三个检索器中实验的 Contriever 在更多实验中表现优于另外两种。此外,Llama 2 和 Llama 3 在不同任务上表现出不同能力,Llama 3 在处理 NER 任务方面表现突出。结论:MMRAG 通过细化例选取来有效提升生物医学情境学习,缓解数据稀缺问题,并在以 NLP 为驱动的医疗保健应用中展现出优异的适应性。

关键词

引用

@article{arxiv.2502.15954,
  title  = {MMRAG: Multi-Mode Retrieval-Augmented Generation with Large Language Models for Biomedical In-Context Learning},
  author = {Zaifu Zhan and Jun Wang and Shuang Zhou and Jiawen Deng and Rui Zhang},
  journal= {arXiv preprint arXiv:2502.15954},
  year   = {2025}
}

备注

Submitted to JAMIA