E3D-GPT:增强的3D医学视觉语言模型基础
图像与视频处理
2024-10-21 v1 计算与语言
计算机视觉与模式识别
摘要
3D医学视觉语言模型的发展对于疾病诊断和患者治疗具有巨大潜力。然而,与2D医学图像相比,3D医学图像(如CT扫描)面临训练数据有限和高维度的挑战,这严重阻碍了3D医学视觉语言模型的进展。为了解决这些问题,我们收集了大量未标记的3D CT数据,并利用自监督学习构建了一个3D视觉基础模型来提取3D视觉特征。然后,我们应用3D空间卷积来聚合和投影高维图像特征,在保留空间信息的同时降低计算复杂度。我们还基于BIMCV-R和CT-RATE构建了两个指令微调数据集。我们的模型在报告生成、视觉问答和疾病诊断方面均优于现有方法。代码和数据集将很快公开。
引用
@article{arxiv.2410.14200,
title = {E3D-GPT: Enhanced 3D Visual Foundation for Medical Vision-Language Model},
author = {Haoran Lai and Zihang Jiang and Qingsong Yao and Rongsheng Wang and Zhiyang He and Xiaodong Tao and Wei Wei and Weifu Lv and S. Kevin Zhou},
journal= {arXiv preprint arXiv:2410.14200},
year = {2024}
}