HSENet:用于 3D 医学视觉-语言理解的混合空间编码网络
计算机视觉与模式识别
2025-06-12 v1 人工智能
摘要
自动 3D CT 诊断通过提升诊断准确性和工作流效率,使临床医生能够做出及时、基于证据的决策。虽然多模态大语言模型(MLLMs)在视觉-语言理解方面展现出令人瞩目的性能,但现有方法主要聚焦于 2D 医学图像,这从根本上限制了其捕捉复杂 3D 解剖结构的能力。这一限制往往导致对细微病理的误读,并引发诊断幻觉。在本文中,我们提出了混合空间编码网络(HSENet),一个通过有效的视觉感知与投影来利用丰富的 3D 医学视觉线索,以实现准确且稳健的视觉-语言理解的框架。具体而言,HSENet 采用双 3D 视觉编码器来感知全局体积上下文和细粒度解剖细节,这些细节通过与诊断报告的双阶段对齐进行预训练。此外,我们提出了空间打包器(Spatial Packer),一种高效的多模态投影器,通过基于质心的压缩将高分辨率 3D 空间区域浓缩为一组信息丰富的视觉标记。通过为空间打包器配备双 3D 视觉编码器,HSENet 能够无缝地感知并传输混合视觉表示到 LLM 的语义空间,从而促进准确的诊断文本生成。实验结果表明,我们的方法在 3D 语言-视觉检索(39.85% 的 R@100,+5.96% 提升)、3D 医学报告生成(24.01% 的 BLEU-4,+8.01% 提升)和 3D 视觉问答(73.60% 的主类准确率,+1.99% 提升)方面达到了最先进的性能,证实了其有效性。我们的代码可在 https://github.com/YanzhaoShi/HSENet 获取。
引用
@article{arxiv.2506.09634,
title = {HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding},
author = {Yanzhao Shi and Xiaodan Zhang and Junzhong Ji and Haoning Jiang and Chengxin Zheng and Yinong Wang and Liangqiong Qu},
journal= {arXiv preprint arXiv:2506.09634},
year = {2025}
}
备注
27 pages, 9 figures. arXiv admin note: text overlap with arXiv:2410.14200 by other authors