面向疾病分类的多模态大语言模型检索增强式上下文学习
人工智能
2025-05-06 v1
摘要
目标:我们旨在动态检索有信息的演示,提高在多模态大语言模型(MLLMs)中进行疾病分类的上下文学习效果。方法:我们提出了检索增强式上下文学习(RAICL)框架,将检索增强生成(RAG)与上下文学习(ICL)集成,以适应选择相似疾病模式的演示,实现更有效的 MLLMs 中的 ICL。具体而言,RAICL 检查来自多种编码器(包括 ResNet、BERT、BioBERT 和 ClinicalBERT)的嵌入,以检索合适的演示,并构建针对 ICL 优化的对话式提示。我们在两个真实世界的多模态数据集(TCGA 和 IU Chest X-ray)上评估了该框架,评估了各种 MLLMs(Qwen、Llava、Gemma)、嵌入策略、相似度度量以及不同演示数量。结果:RAICL 在所有情况下都一致提高了分类性能。TCGA 上准确率从 0.7854 提升至 0.8368,IU Chest X-ray 上准确率从 0.7924 提升至 0.8658。多模态输入优于单模态输入,文本输入优于图像alone。每个模态中嵌入信息的丰富程度将决定可使用的嵌入模型以获得更好结果。few-shot 实验表明,增加检索示例的数量进一步提升了性能。在各种相似度度量下,欧几里得距离实现了最高准确率,而余弦相似度获得了更好的宏平均 F1 分数。RAICL 在各种 MLLMs 上都表现出一致的改进,确认了其鲁棒性和通用性。结论:RAICL 提供了一种高效且可扩展的方法,用于增强 MLLMs 在多模态疾病分类中的上下文学习。
引用
@article{arxiv.2505.02087,
title = {Retrieval-augmented in-context learning for multimodal large language models in disease classification},
author = {Zaifu Zhan and Shuang Zhou and Xiaoshan Zhou and Yongkang Xiao and Jun Wang and Jiawen Deng and He Zhu and Yu Hou and Rui Zhang},
journal= {arXiv preprint arXiv:2505.02087},
year = {2025}
}
备注
17 Pages, 1 figure, 7 tables