中文

基于子抽样随机傅里叶GaLore的方法用于深度驱动的肝脏解剖结构分割适配基础模型

计算机视觉与模式识别 2025-11-06 v1

摘要

在医学影像中精准检测和描绘解剖结构对于计算机辅助干预至关重要,尤其是在腹式肝手术中由于2D视频流限制了深度感知并使解剖 landmark 定位复杂化。虽然最近的研究利用单眼深度线索增强 landmark 检测,但仍面临在融合RGB和深度特征以及高效适配大规模视觉模型到手术领域的挑战。我们提出了一个深度引导的肝脏 landmark 分割框架,通过视觉基础编码器整合语义和几何线索。我们采用Segment Anything Model V2(SAM2)编码器提取RGB特征,采用Depth Anything V2(DA2)编码器提取深度感知特征。为高效适配SAM2,我们引入SRFT-GaLore,一种新型低秩梯度投影方法,用子抽样随机傅里叶变换(SRFT)取代计算昂贵的奇异值分解(SVD),从而在不牺牲表征能力的情况下高效微调高维注意力层。跨注意力融合模块进一步整合RGB和深度线索。为评估跨数据集的泛化能力,我们还构建了一个新的腹式肝手术数据集(LLSD)作为外部验证基准。在公开的L3D数据集上,我们的方法在Dice相似系数上提高了4.85%,在平均对称表面距离上降低了11.78分。为进一步评估泛化能力,我们在LLSD数据集上对模型进行评估。我们的模型保持竞争性能并显著优于基于SAM的基线方法,展示了强大的跨数据集鲁棒性和对未见手术环境的适应性。这些结果表明,我们的SRFT-GaLore增强的双编码器框架在实时、受深度约束的手术环境中实现了可扩展且精确的分割。

关键词

引用

@article{arxiv.2511.03163,
  title  = {Subsampled Randomized Fourier GaLore for Adapting Foundation Models in Depth-Driven Liver Landmark Segmentation},
  author = {Yun-Chen Lin and Jiayuan Huang and Hanyuan Zhang and Sergi Kavtaradze and Matthew J. Clarkson and Mobarak I. Hoque},
  journal= {arXiv preprint arXiv:2511.03163},
  year   = {2025}
}

备注

12 pages