LayerSync:自对齐的中间层
计算机视觉与模式识别
2026-02-20 v2 机器学习
摘要
我们提出了 LayerSync,这是一种用于改进扩散模型生成质量和训练效率的领域无关方法。先前的研究强调了生成质量与扩散模型学习的表示质量之间的关联,表明对模型中间表示的外部指导可加速训练。我们通过对自身中间表示进行正则化来重新概念化这一范式。基于表示质量在扩散模型不同层之间存在差异的观察,我们表明最语义丰富的表示可作为更弱表示的内在指导,从而减少对外部监督的需求。我们的 метод LayerSync 是一种自给自足的、即插即用正则化项,训练期无额外开销,并可推广至除视觉领域外的其他模态。LayerSync 无需预训练模型或额外数据。我们在图像生成上进行了广泛评估,并证明其适用于其他领域,如音频、视频和运动生成。我们表明它在 consistently 改进生成质量和训练效率。例如,在 ImageNet 数据集上,我们将基于流的转换器训练速度提高了 8.75 倍,并将生成质量提高了 23.6%。代码已公开于 https://github.com/vita-epfl/LayerSync。
引用
@article{arxiv.2510.12581,
title = {LayerSync: Self-aligning Intermediate Layers},
author = {Yasaman Haghighi and Bastien van Delft and Mariam Hassan and Alexandre Alahi},
journal= {arXiv preprint arXiv:2510.12581},
year = {2026}
}