中文

Gastric-X:面向胃癌分析的多模态多阶段基准数据集

计算机视觉与模式识别 2026-03-27 v2 人工智能

摘要

最近的视觉语言模型(VLM)在自然领域展现出强大的泛化和多模态推理能力。然而,其在医学诊断中的应用仍受限于缺乏能捕捉真实临床工作流程的全面且结构化数据集。为推动 VLM 在临床应用中的发展,尤其是针对胃癌,我们引入 Gastric-X,一个规模庞大的胃癌分析多模态基准数据集,包含 1.7K 例病例。每个病例包括配对的静息和动态 CT 扫描、内窥镜图像、一组结构化生化指标、专家撰写的诊断记录,以及肿瘤区域的边界框标注,反映了真实的临床情境。我们系统性地检验了最新 VLM 在五个核心任务上的能力:视觉问答(VQA)、报告生成、跨模态检索、疾病分类和肿瘤定位。这些任务模拟了临床工作流程中的关键阶段,从视觉理解和推理到多模态决策支持。通过该评估,我们不仅旨在衡量模型性能,还旨在探讨 VLM 理解的本质:当前的 VLM 能否有意义地将生化信号与空间肿瘤特征及文本报告关联起来?我们设想 Gastric-X 是实现机器智能与医生的认知与证据推理过程对齐的一步,并激发下一代医学 VLM 发展的资源。

关键词

引用

@article{arxiv.2603.19516,
  title  = {Gastric-X: A Multimodal Multi-Phase Benchmark Dataset for Advancing Vision-Language Models in Gastric Cancer Analysis},
  author = {Sheng Lu and Hao Chen and Rui Yin and Juyan Ba and Yu Zhang and Yuanzhe Li},
  journal= {arXiv preprint arXiv:2603.19516},
  year   = {2026}
}

备注

Computer Vision and Pattern Recognition 2026