中文

LLaVA-Med:一天内训练面向生物医学的大型语言与视觉助手

计算机视觉与模式识别 2023-06-02 v1 计算与语言

摘要

会话式生成AI在赋能生物医学从业者方面展现出了显著的前景,但当前的研究主要聚焦于单模态文本。多模态会话AI通过利用来自公共网络的数十亿图文对取得了快速进展,但此类通用领域的视觉语言模型在理解和对话生物医学图像方面仍缺乏精细度。本文中,我们提出了一种高性价比的方法,用于训练能够回答生物医学图像开放式研究问题的视觉语言会话助手。其核心思想是利用从PubMed Central提取的大规模、广覆盖的生物医学图表-标题数据集,使用GPT-4根据标题自生成开放式指令跟随数据,然后采用一种新颖的课程学习方法微调大型通用领域视觉语言模型。具体而言,模型首先利用原样的图表-标题对学习对齐生物医学词汇,然后利用GPT-4生成的指令跟随数据学习掌握开放式会话语义,这广泛模仿了外行人逐步获取生物医学知识的过程。这使我们能够在不到15小时内(使用八块A100)训练出面向生物医学的大型语言与视觉助手(LLaVA-Med)。LLaVA-Med展现出卓越的多模态会话能力,并能遵循开放式指令以协助解答关于生物医学图像的询问。在三个标准的生物医学视觉问答数据集上,LLaVA-Med在某些指标上优于以往有监督的最佳方法。为促进生物医学多模态研究,我们将发布我们的指令跟随数据和LLaVA-Med模型。

关键词

引用

@article{arxiv.2306.00890,
  title  = {LLaVA-Med: Training a Large Language-and-Vision Assistant for Biomedicine in One Day},
  author = {Chunyuan Li and Cliff Wong and Sheng Zhang and Naoto Usuyama and Haotian Liu and Jianwei Yang and Tristan Naumann and Hoifung Poon and Jianfeng Gao},
  journal= {arXiv preprint arXiv:2306.00890},
  year   = {2023}
}

备注

17 pages; Website: https://aka.ms/llava-med