面向域自适应语义分割的Vision Transformer条件UNet
计算机视觉与模式识别
2026-05-19 v1 人工智能
摘要
语义分割是解剖特征分析的关键工具,但Vision Transformer(ViT)在该领域仍存在性能差距,尤其是针对稀疏、细结构和低信噪比目标。我们部分原因归因于可调用ViT模型中常用的轻量级像素解码器,可能缺乏针对高精度生物医学掩码所需的局部归纳偏置。我们通过引入ViTC-UNet,条件化地将UNet置于冻结预训练ViT表示上,通过可学习的token和双向注意力解码器实现。该方法将ViT的全局视觉先验与UNet的局部归纳偏置和高分辨率解码能力相结合,同时在跨域设置下避免端到端ViT微调。ViTC-UNet在MRI和CT模组的语义分割任务中超越了基线结果,表明结构条件化UNet解码可以高效地将大规模视觉先验适应到高复杂度生物医学分割中。
引用
@article{arxiv.2605.16393,
title = {Vision Transformer-Conditioned UNet for Domain-Adaptive Semantic Segmentation},
author = {Joel Valdivia Ortega and Tingying Peng and Marion Jasnin},
journal= {arXiv preprint arXiv:2605.16393},
year = {2026}
}