SigVLP:面向自监督 CT 体积自适应表示学习的 Sigmoid 体积-语言预训练
计算机视觉与模式识别
2026-02-26 v1
摘要
大规模体积医学成像数据集通常来自不同供应商和设备,导致分辨率、切片厚度和每个研究的切片数高度可变。因此,训练表示模型通常需要对 z 轴进行裁切或插值,以获得固定大小的块,这不可避免地会导致信息丢失。我们提出了一种新的训练方法来克服这一限制。我们不使用绝对位置嵌入,而是将体积解释为 3D 块序列,采用旋转位置嵌入,使我们能够将 z 轴视为不受约束的时序维度。基于这一思想,我们引入了一种新的视觉-语言模型:SigVLP。在 SigVLP 中,我们将旋转位置嵌入用作位置编码方法,其直接应用于注意力运算中,生成输入依赖的正弦和余弦权重。这一设计确保查询和键投影之间的一致对齐,并适应任何输入尺寸。在训练期间允许可变输入大小方面,我们对计算断层扫描体积进行块状抽样,并将其与局部器官相关文本观察信息配对。与使用整个报告进行条件控制相比,块状对齐提供更细粒度的监督,使模型能够在文本和体积表示之间建立更强的关联,从而提高文本到体积对齐的精度。我们使用 Muon 优化器训练模型,并在 diverse set of downstream tasks 上进行评估,包括零样本异常和器官分类、分割和检索任务。
引用
@article{arxiv.2602.21735,
title = {SigVLP: Sigmoid Volume-Language Pre-Training for Self-Supervised CT-Volume Adaptive Representation Learning},
author = {Jiayi Wang and Hadrien Reynaud and Ibrahim Ethem Hamamci and Sezgin Er and Suprosanna Shit and Bjoern Menze and Bernhard Kainz},
journal= {arXiv preprint arXiv:2602.21735},
year = {2026}
}