PeFoMed:面向医学影像的多模态大语言模型的参数高效微调
计算与语言
2025-01-17 v3 人工智能
摘要
多模态大语言模型(MLLMs)代表了传统大语言模型能力的演进式扩展,使其能够应对超越纯文本应用范畴的挑战。它利用了这些语言模型中先前编码的知识,从而增强了它们在多模态场景中的适用性和功能性。近期研究探索将MLLMs作为通用解决方案,以生成式任务的方式处理医学多模态问题。本文提出了一种用于微调MLLMs的参数高效框架,并在公开基准数据集上针对医学视觉问答(Med-VQA)和医学报告生成(MRG)任务进行了验证。我们还引入了一种使用5点李克特量表及其加权平均值的评估指标,用于衡量MRG任务中生成报告的质量,其中量表评分由人工和GPT-4模型共同标注。我们进一步评估了VQA和MRG任务中传统度量、GPT-4和人工评分之间性能指标的一致性。结果表明,使用GPT-4进行的语义相似性评估与人工标注者高度一致,且稳定性更高,但与传统的词汇相似性度量相比存在差异。这质疑了词汇相似性度量在评估Med-VQA和报告生成任务中生成模型性能的可靠性。此外,我们微调的模型显著优于GPT-4v。这表明,像GPT-4v这样的多模态模型在没有额外微调的情况下,在医学影像任务上表现不佳。代码将在此处提供:https://github.com/jinlHe/PeFoMed。
引用
@article{arxiv.2401.02797,
title = {PeFoMed: Parameter Efficient Fine-tuning of Multimodal Large Language Models for Medical Imaging},
author = {Jinlong He and Pengfei Li and Gang Liu and Genrong He and Zhaolin Chen and Shenjun Zhong},
journal= {arXiv preprint arXiv:2401.02797},
year = {2025}
}
备注
12 pages, 8 figures, 12 tables