UIT-Saviors 在 MEDVQA-GI 2023:通过图像增强改进多模态学习用于胃肠视觉问答
计算机视觉与模式识别
2023-11-21 v2 人机交互
摘要
近年来,人工智能在医学和疾病诊断中发挥了重要作用,有许多应用值得提及,其中之一是医学视觉问答(MedVQA)。通过结合计算机视觉和自然语言处理,MedVQA 系统可协助专家基于给定问题从医学图像中提取相关信息并提供精确诊断答案。ImageCLEFmed-MEDVQA-GI-2023 挑战赛在胃肠领域开展了视觉问答任务,包含胃镜和结肠镜图像。我们的团队通过提出一种带图像增强的多模态学习方法来处理该挑战的任务 1,以改进胃肠图像上的 VQA 性能。该多模态架构使用 BERT 编码器和基于卷积神经网络(CNN)与 Transformer 架构的不同预训练视觉模型,分别从问题和内镜图像中提取特征。本研究结果突显了基于 Transformer 的视觉模型相对于 CNN 的主导地位,并证明了图像增强过程的有效性,八种视觉模型中有六种取得了更好的 F1 分数。我们的最佳方法结合了 BERT+BEiT 融合与图像增强,在开发测试集上取得了高达 87.25% 的准确率和 91.85% 的 F1 分数,同时在私有测试集上也取得了 82.01% 准确率的好结果。
引用
@article{arxiv.2307.02783,
title = {UIT-Saviors at MEDVQA-GI 2023: Improving Multimodal Learning with Image Enhancement for Gastrointestinal Visual Question Answering},
author = {Triet M. Thai and Anh T. Vo and Hao K. Tieu and Linh N. P. Bui and Thien T. B. Nguyen},
journal= {arXiv preprint arXiv:2307.02783},
year = {2023}
}
备注
ImageCLEF2023 published version: https://ceur-ws.org/Vol-3497/paper-129.pdf