PMC-VQA:面向医学视觉问答的视觉指令微调
计算机视觉与模式识别
2024-09-10 v6
摘要
医学视觉问答(MedVQA)通过利用人工智能基于医学图像解读并回答问题,在提升诊断准确性与医疗服务方面具有重要机遇。在本研究中,我们将 MedVQA 问题重构为遵循人机交互的自然生成任务,并提出一种通过将预训练视觉编码器的视觉信息与大语言模型对齐来实现医学视觉理解的基于生成的模型。我们建立可扩展流程以构建大规模医学视觉问答数据集 PMC-VQA,其包含 149k 图像上的 227k 个 VQA 对,涵盖多种模态或疾病。我们在 PMC-VQA 上训练所提模型,随后在多个公开基准(如 VQA-RAD、SLAKE 和 Image-Clef-2019)上微调,在生成相关、准确的自由形式答案方面显著优于现有 MedVQA 模型。此外,我们提出一个经过人工核验、难度显著更高的测试集,以更好地监测生成式 MedVQA 方法的发展。为便于综合评估与比较,我们在 https://paperswithcode.com/paper/pmc-vqa-visual-instruction-tuning-for-medical 维护了排行榜,提供追踪进展与基准测试的集中资源。PMC-VQA 数据集成为该研究领域的重要资源,MedVInT 在 MedVQA 领域取得了显著突破。
引用
@article{arxiv.2305.10415,
title = {PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering},
author = {Xiaoman Zhang and Chaoyi Wu and Ziheng Zhao and Weixiong Lin and Ya Zhang and Yanfeng Wang and Weidi Xie},
journal= {arXiv preprint arXiv:2305.10415},
year = {2024}
}