基于DINOv3引导的语义感知CBCT到MRI的CT生成跨融合框架
计算机视觉与模式识别
2025-11-18 v1
摘要
从CBCT或MRI生成合成CT图像具有高效剂量规划与自适应放疗的潜力。然而,现有CNN模型缺乏全局语义理解,Transformer常因模型容量大与 inductive bias弱而在小型医疗数据集上过拟合。为此,我们提出DINOv3引导的跨融合框架(DGCF),将冻结的自监督DINOv3 Transformer与可训练CNN编码器-解码器集成,通过可学习的跨融合模块层次化融合Transformer的全局表征与CNN的局部特征,实现局部外观与上下文表征的平衡。进一步引入多级DINOv3感知损失(MLDP),鼓励合成CT在DINOv3特征空间中的语义相似性。SynthRAD2023骨盆数据集上的实验表明,DGCF在MRI→CT与CBCT→CT翻译任务中,以MS-SSIM、PSNR及分割指标实现最先进性能。据称此例是首次运用DINOv3表征进行医学图像翻译,凸显自监督Transformer指导在语义感知CT合成中的潜力。代码已公开于https://github.com/HiLab-git/DGCF。
引用
@article{arxiv.2511.12098,
title = {DINOv3-Guided Cross Fusion Framework for Semantic-aware CT generation from MRI and CBCT},
author = {Xianhao Zhou and Jianghao Wu and Ku Zhao and Jinlong He and Huangxuan Zhao and Lei Chen and Shaoting Zhang and Guotai Wang},
journal= {arXiv preprint arXiv:2511.12098},
year = {2025}
}