中文

有效微调以改进大型多模态模型用于放射学报告生成

计算机视觉与模式识别 2023-12-05 v1 人工智能 计算与语言 机器学习

摘要

根据医学图像撰写放射学报告需要极高的领域专业知识。即使对于训练有素的放射科医师来说,这也是一项耗时的工作,而对于经验不足的放射科医师来说则容易出错。利用生成式 AI 来实现这一任务的自动化将极具吸引力,该技术在视觉和语言理解方面已展现出长足的进步。特别是,大型语言模型(LLM)最近展示了令人印象深刻的能力,并几乎在所有自然语言任务上不断刷新 SOTA 性能。虽然许多人提出了将视觉模型与 LLM 结合以处理多模态任务的架构,但很少有人探索实际的微调策略。在这项工作中,我们提出了一种简单而有效的两阶段微调协议,将视觉特征对齐到 LLM 的文本嵌入空间中作为软视觉提示。我们基于 OpenLLaMA-7B 的框架在没有领域特定预训练的情况下达到了 SOTA 级别的性能。此外,我们对软视觉提示和注意力机制进行了详细分析,为未来的研究方向提供了启示。

关键词

引用

@article{arxiv.2312.01504,
  title  = {Effectively Fine-tune to Improve Large Multimodal Models for Radiology Report Generation},
  author = {Yuzhe Lu and Sungmin Hong and Yash Shah and Panpan Xu},
  journal= {arXiv preprint arXiv:2312.01504},
  year   = {2023}
}

备注

Accepted to Deep Generative Models for Health Workshop at NeurIPS 2023