ViX-Ray:面向视觉语言模型的越南胸片数据集
计算与语言
2026-03-17 v1
摘要
越南医学研究正变得越来越重要,尤其是以智能技术为目标,以减少临床诊断中的时间和资源负担。近期在视觉语言模型 (VLM) 方面的进展,如 Gemini 和 GPT-4V,已引发日益增长的兴趣,将 AI 应用于医疗保健。然而,大多数现有的 VLM 缺乏对越南医疗数据的暴露,限制了其为越南患者生成准确且语境恰当的诊断输出的能力。为此,我们引入 ViX-Ray,一个新的数据集,包含 5,400 张来自越南某大型医院的胸片 X 光图像,配有专家编写的发现和印象注释。我们分析了数据集中的语言模式,包括提及身体部位和诊断的频率,以识别越南放射学报告的特定语言特征。此外,我们在 ViX-Ray 上 fine-tune 五个最先进的开源 VLM,并将其性能与领先的专有模型 GPT-4V 和 Gemini 进行比较。我们的结果表明,尽管多个模型生成的输出部分与临床真实情况相符合,但它们常常表现出低精度和过度幻觉,尤其是在印象生成方面。这些发现不仅显示了该数据集的复杂性和挑战,也将 ViX-Ray 确立为评估和推动越南临床领域视觉语言模型的有价值基准。
引用
@article{arxiv.2603.15513,
title = {ViX-Ray: A Vietnamese Chest X-Ray Dataset for Vision-Language Models},
author = {Duy Vu Minh Nguyen and Chinh Thanh Truong and Phuc Hoang Tran and Hung Tuan Le and Nguyen Van-Thanh Dat and Trung Hieu Pham and Kiet Van Nguyen},
journal= {arXiv preprint arXiv:2603.15513},
year = {2026}
}