Stylizing ViT:面向领域泛化的解剖保持实例风格迁移
计算机视觉与模式识别
2026-01-27 v1 机器学习
图像与视频处理
摘要
在医学图像分析中,深度学习模型常因数据异质性和稀缺性而在跨领域和跨人群组的泛化能力上表现不佳。传统的数据增强方法能提升鲁棒性,但在面对显著的领域偏移时失效。近期风格化增强的进展通过改变图像风格来增强领域泛化,但在风格多样性方面存在不足,或会在生成的图像中引入伪影。为解决这些局限,我们提出Stylizing ViT,一种新颖的视觉Transformer编码器,它利用权重共享的注意力模块同时处理自注意力和交叉注意力。这种设计使得同一个注意力模块能够通过自注意力保持解剖结构的一致性,同时通过交叉注意力执行风格迁移。我们通过将该方法用于组织病理学和皮肤病学领域的三个不同图像分类任务的数据增强,评估了其在领域泛化方面的有效性。结果表明,与现有最先进方法相比,鲁棒性得到提升(准确率最高提升13%),同时生成了无伪影的、感知上令人信服的图像。此外,我们展示了Stylizing ViT在训练之外同样有效:在测试时增强中用于推理时,性能提升了17%。源代码可在 https://github.com/sdoerrich97/stylizing-vit 获取。
引用
@article{arxiv.2601.17586,
title = {Stylizing ViT: Anatomy-Preserving Instance Style Transfer for Domain Generalization},
author = {Sebastian Doerrich and Francesco Di Salvo and Jonas Alle and Christian Ledig},
journal= {arXiv preprint arXiv:2601.17586},
year = {2026}
}
备注
Accepted at 23rd IEEE International Symposium on Biomedical Imaging (IEEE ISBI 2026)