面向消化道 VQA 的多任务学习中的视觉锚定推理
计算机视觉与模式识别
2025-11-07 v1 机器学习
摘要
我们提出了一个针对 MediaEval Medico 2025 挑战的多任务框架,利用 LoRA 微调的 Florence-2 模型实现视觉问答(VQA)、解释生成和视觉锚定的同步学习。该系统集成了三个精选数据集:(1)Kvasir-VQA-x1 用于问答学习,(2)合成丰富化的解释数据集提供结构化的医学推理,(3)将视觉特征与分割掩码关联的文本到区域配对。这种多任务设置使模型能够联合学习视觉锚定、推理和解释,生成既准确又可解释的响应。广泛的评估表明,我们的方法在答案准确性和视觉局部化方面均显著优于单任务基线,凸显了基于扎根的多任务学习在医学 VQA 应用中的有效性。
关键词
引用
@article{arxiv.2511.04384,
title = {Multi-Task Learning for Visually Grounded Reasoning in Gastrointestinal VQA},
author = {Itbaan Safwan and Muhammad Annas Shaikh and Muhammad Haaris and Ramail Khan and Muhammad Atif Tahir},
journal= {arXiv preprint arXiv:2511.04384},
year = {2025}
}
备注
This is a working paper submitted for Medico 2025: Visual Question Answering (with multimodal explanations) for Gastrointestinal Imaging at MediaEval 2025. 5 pages, 3 figures and 1 table