扩大生物医学视觉语言模型:细调、指令调优与多模态学习
人工智能
2025-05-26 v1
摘要
通过扩大规模、细调和指令调优来提升生物医学视觉语言模型能力,开发在处理长文本方面表现更佳的视觉语言模型,探索高效采用视觉语言模型应用于多样化多模态生物医学任务的策略,并检验零样本学习性能。我们开发了两个生物医学视觉语言模型,BiomedGPT-Large 和 BiomedGPT-XLarge,基于编码器-解码器架构的变换模型。我们在包括一项仅图像任务(图像分类)、三项仅语言任务(文本理解、文本摘要和问答)以及两项视觉语言任务(视觉问答和图像描述生成)在内的6项多模态生物医学任务上的23个基准数据集上对这两个模型进行细调。我们将所开发的规模化模型与先前的BiomedGPT-Base模型以及文献中报道的现有著名模型进行了比较。我们使用大规模多模态生物医学指令调优数据集对这两个模型进行指令调优,并评估了零样本学习性能和对齐精度。
引用
@article{arxiv.2505.17436,
title = {Scaling Up Biomedical Vision-Language Models: Fine-Tuning, Instruction Tuning, and Multi-Modal Learning},
author = {Cheng Peng and Kai Zhang and Mengxian Lyu and Hongfang Liu and Lichao Sun and Yonghui Wu},
journal= {arXiv preprint arXiv:2505.17436},
year = {2025}
}