中文

基于 OphthalWeChat 的眼科视觉问答大型多模态模型基准测试

计算机视觉与模式识别 2025-05-27 v1 人工智能

摘要

目的:开发一个双语多模态视觉问答(VQA)基准,用于评估眼科领域的视觉语言模型(VLM)。方法:从微信公众号收集了 2016 年 1 月 1 日至 2024 年 12 月 31 日期间发布的眼科图像帖子及相关说明文字。基于这些说明文字,利用 GPT-4o-mini 生成了中英双语问答(QA)对。QA 对按问题类型和语言分为六个子集:二分类(Binary_CN, Binary_EN)、单选(Single-choice_CN, Single-choice_EN)和开放式(Open-ended_CN, Open-ended_EN)。该基准用于评估三个 VLM 的性能:GPT-4o、Gemini 2.0 Flash 和 Qwen2.5-VL-72B-Instruct。结果:最终的 OphthalWeChat 数据集包含 9 个眼科亚专科、548 种疾病、29 种成像模态和 68 种模态组合的 3,469 张图像和 30,120 个 QA 对。Gemini 2.0 Flash 取得了最高的总体准确率(0.548),优于 GPT-4o(0.522, P < 0.001)和 Qwen2.5-VL-72B-Instruct(0.514, P < 0.001)。它在中文(0.546)和英文子集(0.550)中均领先。特定子集的性能显示,Gemini 2.0 Flash 在 Binary_CN(0.687)、Single-choice_CN(0.666)和 Single-choice_EN(0.646)中表现优异,而 GPT-4o 在 Binary_EN(0.717)、Open-ended_CN(BLEU-1: 0.301; BERTScore: 0.382)和 Open-ended_EN(BLEU-1: 0.183; BERTScore: 0.240)中排名最高。结论:本研究提出了首个眼科双语 VQA 基准,其特点在于真实世界背景及包含每位患者的多种检查。该数据集反映了真实的临床决策场景,能够对 VLM 进行定量评估,支持开发准确、专业且可信赖的眼科 AI 系统。

关键词

引用

@article{arxiv.2505.19624,
  title  = {Benchmarking Large Multimodal Models for Ophthalmic Visual Question Answering with OphthalWeChat},
  author = {Pusheng Xu and Xia Gong and Xiaolan Chen and Weiyi Zhang and Jiancheng Yang and Bingjie Yan and Meng Yuan and Yalin Zheng and Mingguang He and Danli Shi},
  journal= {arXiv preprint arXiv:2505.19624},
  year   = {2025}
}