面向姿态鲁棒文本到图像扩散的生成与外观隐变量双重递归反馈
计算机视觉与模式识别
2025-08-14 v1
摘要
可控文本到图像(T2I)扩散模型的最新进展,如 Ctrl-X 和 FreeControl,已展现出无需辅助模块训练即可实现鲁棒的空间与外观控制。然而,这些模型往往难以精确保持空间结构,且无法捕捉与物体姿态和场景布局相关的细粒度条件。为解决这些挑战,我们提出了一种无需训练的双重递归反馈(DRF)系统,可在可控 T2I 模型中恰当地反映控制条件。所提出的 DRF 由外观反馈和生成反馈组成,递归地细化中间隐变量,以更好地反映给定的外观信息和用户意图。这种双重更新机制将隐变量表示引导至可靠的流形,有效整合了结构属性和外观属性。我们的方法甚至能在类别不变的结构-外观融合之间实现细粒度生成,例如将人体运动迁移到老虎形态上。大量实验证明了我们的方法在生成高质量、语义连贯且结构一致的图像方面的有效性。源代码见 https://github.com/jwonkm/DRF。
引用
@article{arxiv.2508.09575,
title = {Dual Recursive Feedback on Generation and Appearance Latents for Pose-Robust Text-to-Image Diffusion},
author = {Jiwon Kim and Pureum Kim and SeonHwa Kim and Soobin Park and Eunju Cha and Kyong Hwan Jin},
journal= {arXiv preprint arXiv:2508.09575},
year = {2025}
}