中文

VoxTell:自由文本可调用的通用 3D 医学图像分割

计算机视觉与模式识别 2025-11-17 v1 机器学习

摘要

我们介绍 VoxTell,这是一个面向文本提示的 3D 医学图像分割视觉语言模型。它将从单个词到完整临床句子的自由形式描述映射到 3D 掩模。该模型基于超过 62K 例 CT、MRI 和 PET 体数据训练,涵盖 1K 多个解剖学和病理学类别。VoxTell 采用多阶段视觉语言融合,跨越解码器层在多个尺度上对文本与视觉特征进行对齐。它在未见数据集上实现了跨模态的零样性能,既在熟悉概念上表现卓越,也能泛化到相关未见类别。大量实验进一步表明其具有强大的跨模态迁移能力、对语言变体和临床语言的鲁棒性,以及来自真实场景文本的准确实例分割能力。代码已公开:https://www.github.com/MIC-DKFZ/VoxTell

关键词

引用

@article{arxiv.2511.11450,
  title  = {VoxTell: Free-Text Promptable Universal 3D Medical Image Segmentation},
  author = {Maximilian Rokuss and Moritz Langenberg and Yannick Kirchhoff and Fabian Isensee and Benjamin Hamm and Constantin Ulrich and Sebastian Regnery and Lukas Bauer and Efthimios Katsigiannopulos and Tobias Norajitra and Klaus Maier-Hein},
  journal= {arXiv preprint arXiv:2511.11450},
  year   = {2025}
}