MedVista3D: 视觉-语言建模用于降低3D CT疾病检测、理解与报告中的诊断错误
计算机视觉与模式识别
2025-09-05 v1
摘要
放射学诊断错误——读片不足、注意力盲区和沟通失败——在临床实践中仍然普遍存在。这些问题通常源于遗漏局部异常、有限的全局上下文以及报告语言的差异性。这些挑战在3D成像中被放大,因为临床医生每次扫描需要检查数百个切片。解决这些问题需要具备精确的局部检测、全局体积级推理和语义一致的自然语言报告的系统。然而,现有的3D视觉-语言模型无法同时满足这三个需求,缺乏用于空间推理的局部-全局理解,并且难以应对未经整理的放射学报告中的变异性和噪声。我们提出了MedVista3D,一个用于3D CT分析的多尺度语义增强视觉-语言预训练框架。为了实现联合疾病检测和整体解释,MedVista3D在全体积上下文中执行局部和全局图像-文本对齐,以实现细粒度表示学习。为了解决报告变异性问题,我们采用语言模型重写并引入放射学语义匹配库以实现语义感知对齐。MedVista3D在零样本疾病分类、报告检索和医学视觉问答方面取得了最先进的性能,同时在器官分割和预后预测方面也表现出良好的迁移能力。代码和数据集将公开发布。
引用
@article{arxiv.2509.03800,
title = {MedVista3D: Vision-Language Modeling for Reducing Diagnostic Errors in 3D CT Disease Detection, Understanding and Reporting},
author = {Yuheng Li and Yenho Chen and Yuxiang Lai and Jike Zhong and Vanessa Wildman and Xiaofeng Yang},
journal= {arXiv preprint arXiv:2509.03800},
year = {2025}
}