分析图像修复 Transformer 的训练动力学:关于层归一化问题的重新审视
计算机视觉与模式识别
2026-02-23 v3
摘要
本工作分析了图像修复 (IR) Transformer 的训练动力学,揭示了一个关键且被忽视的问题:常规层归一化 (LN) 导致特征幅度发散至百万级并导致通道级熵崩溃。我们从网络试图规避与 IR 任务冲突的 LN 约束的角度进行分析。因此,我们针对 LN 与 IR 之间的两个误对齐问题:1) 逐标记归一化破坏了空间相关性;2) 输入独立的缩放丢弃了输入特定的统计信息。为解决此问题,我们提出了针对图像修复 Transformer 定制的层归一化 i-LN,这是一种简单且可即插即用的替换方案,对特征进行整体归一化并对输入进行自适应缩放。我们提供了理论见解和实证证据,表明这种简单设计有效提升了训练动力学和性能,经大量实验验证。
引用
@article{arxiv.2504.06629,
title = {Analyzing the Training Dynamics of Image Restoration Transformers: A Revisit to Layer Normalization},
author = {MinKyu Lee and Sangeek Hyun and Woojin Jun and Hyunjun Kim and Jiwoo Chung and Jae-Pil Heo},
journal= {arXiv preprint arXiv:2504.06629},
year = {2026}
}
备注
Codes are available at: https://github.com/2minkyulee/i-LN