面向图像去噪的教师引导因果干预:视觉Transformer中的正交内容-噪声解�合
计算机视觉与模式识别
2026-03-03 v1
摘要
传统图像去噪模型常常不慎学习到环境因素与噪声模式之间的伪相关性。此外,由于高频歧义,它们难以可靠地区分细微纹理与随机噪声,导致过度去除细节或残留噪声迹象。因此,我们重新审视基于因果干预的去噪方法,认为纯关联性拟合会将内在内容与外在噪声 entangled,从而直接降低分布迁移下的鲁棒性。灵感来自于此,我们提出了教师引导因果解�合网络(TCD-Net),在视觉Transformer框架内通过结构化干预显式分解生成机制。具体而言,该方法集成了三个关键组件:(1)环境偏差调整(EBA)模块将特征投影到稳定的去中心化子空间,以抑制全局环境偏差(去相关)。(2)双分支解�合头采用正交约束,强制内容与噪声表示之间的严格分离,防止信息泄漏。(3)为解决结构歧义,我们利用Nano Banana Pro(谷歌推出的推理引导AI图像生成模型)指导因果先验,有效将内容表示拉回自然图像流形上。广泛的实验表明,TCD-Net在多个基准测试中在保真度和效率方面均优于主流方法,在单张RTX 5090 GPU上实现最高达104.2 FPS的实时速度。
引用
@article{arxiv.2603.01140,
title = {Teacher-Guided Causal Interventions for Image Denoising: Orthogonal Content-Noise Disentanglement in Vision Transformers},
author = {Kuai Jiang and Zhaoyan Ding and Guijuan Zhang and Dianjie Lu and Zhuoran Zheng},
journal= {arXiv preprint arXiv:2603.01140},
year = {2026}
}