中文

NOFT:基于信息瓶颈的测试时噪声微调,用于高度相关的资产创建

计算机视觉与模式识别 2025-05-20 v1

摘要

扩散模型为实现文本到图像(T2I)和图像到图像(I2I)生成提供了强大的工具。最近,拓扑和纹理控制成为受欢迎的探索,例如 ControlNet、IP-Adapter、Ctrl-X 和 DSG。这些方法明确考虑基于外部信号或扩散特征操纵的高保真可控编辑。就多样性而言,它们直接选择不同的噪声潜在向量。然而,扩散噪声能够隐式地表示相应图像的拓扑和纹理流形。此外,它是进行内容保持与可控变体之间权衡的有效工作台。以往的 T2I 和 I2I 扩散工作并未探索压缩上下文潜在中的信息。本文首次提出一种即插即用的噪声微调 NOFT 模块,可用于 Stable Diffusion 生成高度相关且多样的图像。我们通过约仅 14K 可训练参数和 10 分钟的训练,对种子噪声或逆向噪声进行通过最优传输(OT)信息瓶颈(Information Bottleneck, IB)进行微调。我们的测试时 NOFT 在考虑拓扑和纹理对齐方面能够产生高保真的图像变体。综合实验表明,NOFT 是一种强大的通用方法,能够有效地根据文本或图像指导微调 2D/3D AIGC 资产。

关键词

引用

@article{arxiv.2505.12235,
  title  = {NOFT: Test-Time Noise Finetune via Information Bottleneck for Highly Correlated Asset Creation},
  author = {Jia Li and Nan Gao and Huaibo Huang and Ran He},
  journal= {arXiv preprint arXiv:2505.12235},
  year   = {2025}
}