VOILA:基于体素与语言交互的 CT 图像通用分割
计算机视觉与模式识别
2025-01-08 v1
摘要
近期在 CT 图像通用分割方面取得了令人满意的进展。跟随视觉-语言方法的成功趋势,越来越多地利用文本提示和对比学习来开发通用分割模型。然而,3D 图像与文本提示之间信息密度存在显著不平衡。此外,标准的全连接层分割方法在处理多个类别时面临重大挑战,泛化性差。为此,我们提出了基于体素与语言交互的 CT 图像通用分割方法(VOxel Interacting with LAnguage,VOILA)。首先,我们将体素和语言对齐到共享的表示空间,并基于余弦相似度对体素进行分类。随后,我们开发了体素-语言交互框架,以减轻由前景-背景差异和目标体积变化导致的类别不平衡影响。进一步,提出了一种复杂度感知采样方法,通过生成可训练的高斯混合分布的伪热图来聚焦于难以分割的区域。我们的结果表明,所提出的 VOILA 能够在训练时实现更好的性能,同时具有更少的参数和计算成本。此外,它在无需额外微调的情况下显示出对多样数据集的显著通用性。
引用
@article{arxiv.2501.03482,
title = {VOILA: Complexity-Aware Universal Segmentation of CT images by Voxel Interacting with Language},
author = {Zishuo Wan and Yu Gao and Wanyuan Pang and Dawei Ding},
journal= {arXiv preprint arXiv:2501.03482},
year = {2025}
}
备注
Accepted by AAAI 2025