3DMedAgent:3D 医学分析中的统一感知到理解
计算机视觉与模式识别
2026-03-10 v2
摘要
3D CT 分析涉及从低层感知到高层临床理解的连续过程。现有 3D 导向方法采用要么是孤立的任务特定建模,要么是任务中性的端到端范式来产生单跳输出,阻碍了对下游推理的感知证据的系统性累积。并行地,最近的多模态大语言模型(MLLM)表现出 improved 的视觉感知能力,并能有效整合视觉和文本信息,但其主要以 2D 为导向的设计从根本上限制了其感知和分析体积医学数据的能力。为填补这一差距,我们提出 3DMedAgent,一种统一的智能体,使其能够在无需 3D 特定微调的情况下,使通用 2D MLLM 能够进行一般 3D CT 分析。3DMedAgent 通过灵活的 MLLM 智能体协调异构的视觉和文本工具,逐步将复杂的 3D 分析分解为可管理的子任务,这些子任务从全局视图过渡到局部视图,从 3D 体积过渡到信息化 2D 切片,从视觉证据过渡到结构化文本表示。本设计的核心在于,3DMedAgent 维护一个长期结构化记忆,聚合中间工具输出,并支持查询自适应、证据驱动的多步骤推理。我们进一步引入 DeepChestVQA 数据集,用于评估 3D 胸部影像中统一感知到理解能力。实验在 40 多个任务上表明,3DMedAgent 持续优于通用、医学和 3D 特定 MLLM,凸显了通用 3D 临床助手的可扩展路径。代码和数据可在 \href{https://github.com/jinlab-imvr/3DMedAgent}{https://github.com/jinlab-imvr/3DMedAgent} 获取。
引用
@article{arxiv.2602.18064,
title = {3DMedAgent: Unified Perception-to-Understanding for 3D Medical Analysis},
author = {Ziyue Wang and Linghan Cai and Chang Han Low and Haofeng Liu and Junde Wu and Jingyu Wang and Rui Wang and Lei Song and Jiang Bian and Jingjing Fu and Yueming Jin},
journal= {arXiv preprint arXiv:2602.18064},
year = {2026}
}
备注
19 pages, 7 figures