面向胃肠道诊断的多模态 AI: Tackling MEDVQA-GI 2025 中的 VQA
计算机视觉与模式识别
2025-07-22 v1 人工智能
摘要
本文描述了我们方法用于 MEDVQA 2025 挑战子任务 1 的方案,即针对胃肠道内窥镜视觉问答 (VQA)。我们采用 Florence 模型——一种大规模多模态基础模型——作为 VQA 流程的骨架,配合强大的视觉编码器和文本编码器来解释内窥镜图像并生成临床相关答案。为提高泛化能力,我们应用了保留医学特征的领域特定数据增强技术。在 KASVIR 数据集上的实验表明,微调 Florence 能在挑战官方指标上获得准确的响应。我们的结果凸显了大型多模态模型在医学 VQA 中的潜力,并为未来在可解释性、鲁棒性和临床集成方面的工作提供了强大的基线。代码已公开于:https://github.com/TiwariLaxuu/VQA-Florence.git
引用
@article{arxiv.2507.14544,
title = {Multimodal AI for Gastrointestinal Diagnostics: Tackling VQA in MEDVQA-GI 2025},
author = {Sujata Gaihre and Amir Thapa Magar and Prasuna Pokharel and Laxmi Tiwari},
journal= {arXiv preprint arXiv:2507.14544},
year = {2025}
}
备注
accepted to ImageCLEF 2025, to be published in the lab proceedings