中文

面向医学报告生成的通用基础模型定制

计算机视觉与模式识别 2023-06-12 v1 人工智能 计算与语言 信息检索

摘要

医学描述预测可视为医学报告生成(MRG)的一项任务,要求为给定医学图像自动生成连贯且准确的描述。然而,带标注的医学图像-报告对的稀缺性,给开发能够利用如大语言模型(LLMs)等潜在人工智能通用能力的深层大规模神经网络带来了巨大挑战。在本工作中,我们提出定制现成的通用大规模预训练模型,即计算机视觉与自然语言处理中的基础模型(FMs),并特别关注医学报告生成。具体而言,遵循最先进的视觉-语言预训练方法 BLIP-2,我们引入了基于编码器-解码器的 MRG 模型。该模型利用轻量级查询 Transformer 连接两个 FMs:巨型视觉 Transformer EVA-ViT-g 和一个为与人类意图对齐而训练的双语 LLM(称为 ChatGLM-6B)。此外,我们在模型可训练组件上进行了消融实验,以识别有效迁移学习的关键因素。我们的发现表明,解冻 EVA-ViT-g 以学习医学图像表征,随后对 ChatGLM-6B 进行参数高效训练以捕捉医学报告的写作风格,是实现最优结果的关键。在 ImageCLEFmedical Caption 2023 Caption Prediction Task 竞赛中,我们的最佳尝试(PCLmed Team)基于 BERTScore 和 ROUGE-1 指标,在 13 支参赛队伍中分别获得第 4 名和第 2 名。

关键词

引用

@article{arxiv.2306.05642,
  title  = {Customizing General-Purpose Foundation Models for Medical Report Generation},
  author = {Bang Yang and Asif Raza and Yuexian Zou and Tong Zhang},
  journal= {arXiv preprint arXiv:2306.05642},
  year   = {2023}
}

备注

14 pages, 3 figures