NOFT:基于信息瓶颈的测试时噪声微调,用于高度相关的资产创建
计算机视觉与模式识别
2025-05-20 v1
摘要
扩散模型为实现文本到图像(T2I)和图像到图像(I2I)生成提供了强大的工具。最近,拓扑和纹理控制成为受欢迎的探索,例如 ControlNet、IP-Adapter、Ctrl-X 和 DSG。这些方法明确考虑基于外部信号或扩散特征操纵的高保真可控编辑。就多样性而言,它们直接选择不同的噪声潜在向量。然而,扩散噪声能够隐式地表示相应图像的拓扑和纹理流形。此外,它是进行内容保持与可控变体之间权衡的有效工作台。以往的 T2I 和 I2I 扩散工作并未探索压缩上下文潜在中的信息。本文首次提出一种即插即用的噪声微调 NOFT 模块,可用于 Stable Diffusion 生成高度相关且多样的图像。我们通过约仅 14K 可训练参数和 10 分钟的训练,对种子噪声或逆向噪声进行通过最优传输(OT)信息瓶颈(Information Bottleneck, IB)进行微调。我们的测试时 NOFT 在考虑拓扑和纹理对齐方面能够产生高保真的图像变体。综合实验表明,NOFT 是一种强大的通用方法,能够有效地根据文本或图像指导微调 2D/3D AIGC 资产。
引用
@article{arxiv.2505.12235,
title = {NOFT: Test-Time Noise Finetune via Information Bottleneck for Highly Correlated Asset Creation},
author = {Jia Li and Nan Gao and Huaibo Huang and Ran He},
journal= {arXiv preprint arXiv:2505.12235},
year = {2025}
}