Fuse4Seg:基于双层优化的多模态医学图像融合分割
计算机视觉与模式识别
2026-03-09 v3
摘要
多模态医学图像融合传统上针对人类视觉感知进行优化,旨在最大化通用对比度和结构保真度。然而,当这些视觉上令人愉悦的融合图像部署于自动化临床工作流时,这种视觉与语义的差异会导致与任务无关的特征退化,无意中平滑掉了关键的高频肿瘤边界。为了弥合这一语义鸿沟,我们提出了 Fuse4Seg,这是一个新颖的框架,将多模态融合与医学分割重新表述为一个协作双层优化问题。我们的融合主导者不再依赖僵化的视觉度量,而是直接由下游分割跟随者反向传播的语义梯度驱动,动态更新其特征提取策略。为了保证语义效用之外的稳健物理保真度,我们设计了一个频率解耦架构,并受到频率分解损失和空间梯度损失的严格正则化。这种显式的物理锚点防止了解剖失真,并确保了任务关键细节的无损保留。大量实验表明,我们这种任务感知的单通道融合先验能够无缝泛化到各种多尺度模态。更令人印象深刻的是,它在明确提供可读的“玻璃箱”物理图像以促进临床视觉可解释性和信任度的同时,显著超越了当代的双通道分割 SOTA 方法。
引用
@article{arxiv.2409.10328,
title = {Fuse4Seg: Image Fusion for Multi-Modal Medical Segmentation via Bi-level Optimization},
author = {Yuchen Guo and Junli Gong and Hongmin Cai and Yiu-ming Cheung and Weifeng Su},
journal= {arXiv preprint arXiv:2409.10328},
year = {2026}
}