中文

轻松实现超高分辨率适配

计算机视觉与模式识别 2025-03-21 v1

摘要

近年来,文本到图像扩散模型取得了显著进展。然而,训练用于高分辨率图像生成的模型仍然具有挑战性,特别是在训练数据和计算资源有限的情况下。在本文中,我们从数据和参数效率这两个关键视角探索这一实际问题,并提出了一套称为 URAE 的超高分辨率适配关键指南。在数据效率方面,我们从理论和经验上证明,由某些教师模型生成的合成数据可以显著促进训练收敛。在参数效率方面,我们发现当合成数据不可用时,微调权重矩阵的次要成分优于广泛使用的低秩适配器,在保持效率的同时提供了显著的性能提升。此外,对于利用引导蒸馏的模型(如 FLUX),我们表明在适配期间禁用无分类器引导(即将引导尺度设为 1)对于获得满意的性能至关重要。大量实验验证了 URAE 仅用 3K 样本和 2K 迭代,即可实现与 FLUX1.1 [Pro] Ultra 等 SOTA 闭源模型相当的 2K 生成性能,同时为 4K 分辨率生成树立了新的基准。代码可在 https://github.com/Huage001/URAE 获取。

关键词

引用

@article{arxiv.2503.16322,
  title  = {Ultra-Resolution Adaptation with Ease},
  author = {Ruonan Yu and Songhua Liu and Zhenxiong Tan and Xinchao Wang},
  journal= {arXiv preprint arXiv:2503.16322},
  year   = {2025}
}

备注

Technical Report. Codes are available \href{https://github.com/Huage001/URAE}{here}