中文

面向医疗数据的视觉-语言基础模型:越南语PET/CT报告生成的多模态数据集与基准

计算机视觉与模式识别 2026-02-03 v3

摘要

视觉-语言基础模型(VLMs)在大规模多模态数据集上训练,通过实现丰富的跨模态推理,推动了人工智能(AI)领域的重大进展。尽管这些模型在通用领域取得了成功,但由于缺乏多样化的成像模态和多语言临床数据,将其应用于医学影像仍具挑战。大多数现有的医学VLMs在部分成像模态上训练,且主要关注高资源语言,从而限制了其泛化能力与临床实用性。为解决这些局限性,我们引入了一个新颖的越南语多模态医疗数据集,包含来自独立患者的2,757个全身PET/CT体数据及其对应的全长临床报告。该数据集旨在填补医学AI发展中的两个迫切空白:(1)现有VLMs训练语料中缺乏PET/CT成像数据,阻碍了能够处理功能成像任务的模型的开发;(2)低资源语言,特别是越南语,在医学视觉-语言研究中的代表性不足。据我们所知,这是首个提供越南语全面PET/CT-报告对的数据集。我们进一步引入了一个训练框架以增强VLMs的学习,包括数据增强和经专家验证的测试集。我们进行了全面实验,在最先进的VLMs的下游任务上进行了基准测试。实验结果表明,引入我们的数据集显著提升了现有VLMs的性能。我们相信该数据集与基准将作为推进医学影像领域更鲁棒VLMs开发的关键一步,特别是针对低资源语言和越南医疗保健中的临床应用。源代码可在 https://github.com/AIoT-Lab-BKAI/ViPET-ReportGen 获取。

关键词

引用

@article{arxiv.2509.24739,
  title  = {Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation},
  author = {Huu Tien Nguyen and Dac Thai Nguyen and The Minh Duc Nguyen and Trung Thanh Nguyen and Thao Nguyen Truong and Huy Hieu Pham and Johan Barthelemy and Minh Quan Tran and Thanh Tam Nguyen and Quoc Viet Hung Nguyen and Quynh Anh Chau and Hong Son Mai and Thanh Trung Nguyen and Phi Le Nguyen},
  journal= {arXiv preprint arXiv:2509.24739},
  year   = {2026}
}

备注

39th Conference on Neural Information Processing Systems (NeurIPS 2025) Track on Datasets and Benchmarks