中文

LLM-CXR:用于胸片图像理解与生成的指令微调大语言模型

计算机视觉与模式识别 2024-03-19 v5 人工智能 计算与语言 机器学习

摘要

随着大语言模型(LLM)的迅猛发展,LLM 中的视觉-语言对齐正被积极研究以实现多模态推理与视觉输入输出。这一研究方向与医学影像尤为相关,因为医学图像的分析与生成依赖于视觉特征与先验知识相结合的推理。许多近期工作聚焦于训练适配器网络,作为图像处理网络与 LLM 之间的信息桥梁;但想必为了充分释放 LLM 在视觉信息上的推理潜力,视觉与语言特征应被允许更自由地交互。这一点在医学领域尤为重要,因为理解与生成诸如胸部 X 光(CXR)等医学图像不仅要求准确的视觉与语言推理,还需要两种模态间更紧密的映射。因此,受先前基于 transformer 与 VQ-GAN 组合实现双向图像与文本生成工作的启发,我们在此方法基础上构建并开发了一种对仅在文本上预训练的 LLM 进行指令微调的方法,使其获得医学图像的视觉-语言能力。具体而言,我们利用预训练 LLM 已有的问答与指令遵循能力,通过指令其回答关于图像输入的问题来教会它理解视觉输入,并对称地,通过以涵盖基于图像文本生成与基于文本图像生成的多样化任务对 LLM 进行微调,使其输出既适合给定查询的文本与图像响应。我们展示了我们的模型 LLM-CXR 以该方法训练后,在 CXR 理解与生成任务中均展现出更好的图像-文本对齐,且规模小于先前开发的执行更窄范围任务的模型。代码见 https://github.com/hyn2028/llm-cxr。

关键词

引用

@article{arxiv.2305.11490,
  title  = {LLM-CXR: Instruction-Finetuned LLM for CXR Image Understanding and Generation},
  author = {Suhyeon Lee and Won Jun Kim and Jinho Chang and Jong Chul Ye},
  journal= {arXiv preprint arXiv:2305.11490},
  year   = {2024}
}

备注

21 pages, 8 figures; ICLR 2024 (poster)