在视觉-语言基础模型中通过 Adapter 微调与知识增强改进医学报告生成
计算机视觉与模式识别
2023-12-08 v1 人工智能
计算工程、金融与科学
摘要
医学报告生成要求为医学图像自动创建连贯且精确的描述。然而,带标注的医学图像-报告对的稀缺,在开发能够利用人工智能潜力的大规模神经网络(如大语言模型)方面构成了巨大挑战。本研究建立在最先进的视觉-语言预训练与微调方法 BLIP-2 之上,以定制通用的大规模基础模型。通过集成 Adapter 微调与医学知识增强损失,我们的模型显著提升了准确性与连贯性。在 ImageCLEFmedical 2023 数据集上的验证展示了我们模型的能力,在多种 SOTA 方法中取得了最佳平均结果。ROUGE 和 CIDEr 方面的显著提升突显了我们方法的有效性,凸显了视觉-语言基础模型在应对数据稀缺挑战时进行快速医学领域适配的良好前景。
引用
@article{arxiv.2312.03970,
title = {Improving Medical Report Generation with Adapter Tuning and Knowledge Enhancement in Vision-Language Foundation Models},
author = {Shibin Wu and Bang Yang and Zhiyu Ye and Haoqian Wang and Hairong Zheng and Tong Zhang},
journal= {arXiv preprint arXiv:2312.03970},
year = {2023}
}