中文

按需尺度:面向扩散模型的训练-free 局部化缩放

计算机视觉与模式识别 2026-03-17 v3

摘要

扩散模型已成为文本到图像生成的主流范式,测试时缩放 (TTS) 通过在推理时分配额外计算提升样本质量。然而,现有 TTS 方法会对整个图像进行重采样,而生成质量往往在空间上呈异质分布。这导致对已正确区域的计算资源浪费,局部缺陷也未得到充分纠正。本文探索新方向——局部化 TTS ——通过自适应重采样有缺陷区域同时保留高质量区域,从而大幅减少搜索空间。此举提出两大挑战:精准定位缺陷及保持全局一致性。我们提出 LoTTS,即首个完全训练-free 的局部化 TTS 框架。针对缺陷定位,LoTTS 通过质量感知提示(如高质量 vs. 低质量)下的交叉注意力与自注意力信号对比,识别出有缺陷区域,再细化为连贯的掩码。针对一致性,LoTTS 只扰动缺陷区域并进行局部去噪,确保修正局限于指定区域而其他区域不受影响。大量实验在 SD2.1、SDXL 和 FLUX 上表明,LoTTS 实现了最前沿性能:在保持全局保真度的同时,持续提升局部质量和整体忠实度,GPU 成本相较 Best-of-N 采样降低 2-4 倍。这些发现表明局部化 TTS 是推进扩散模型推理时刻缩放的有前景新方向。

关键词

引用

@article{arxiv.2511.19917,
  title  = {Scale Where It Matters: Training-Free Localized Scaling for Diffusion Models},
  author = {Qin Ren and Yufei Wang and Lanqing Guo and Wen Zhang and Zhiwen Fan and Chenyu You},
  journal= {arXiv preprint arXiv:2511.19917},
  year   = {2026}
}