PixelPonder:面向增强多条件文本到图像生成的动态块自适应
计算机视觉与模式识别
2026-05-25 v3
摘要
近期基于扩散模型的文本到图像生成通过视觉条件控制展现出了可喜的成果。然而,现有的类 ControlNet 方法在处理组合式视觉条件时面临困难——既要在多个异构控制信号之间保持语义保真度,又要维持高视觉质量。这些方法采用独立的控制分支,在去噪过程中常引入冲突的指导,导致生成图像出现结构失真和伪影。为解决这一问题,我们提出了 PixelPonder,一种新颖的统一控制框架,允许在单一控制结构下对多种视觉条件进行有效控制。具体而言,我们设计了一种块级自适应条件选择机制,在子区域级别动态优先处理空间相关的控制信号,实现精确的局部指导且不产生全局干扰。此外,部署了时间感知控制注入方案,根据去噪时间步调制条件影响,从结构保持逐步过渡到纹理细化,并充分利用来自不同类别的控制信息以促进更和谐的图像生成。大量实验表明,PixelPonder 在不同的基准数据集上超越了以往方法,在保持高文本语义一致性的同时,在空间对齐准确性方面展现出卓越的提升。
引用
@article{arxiv.2503.06684,
title = {PixelPonder: Dynamic Patch Adaptation for Enhanced Multi-Conditional Text-to-Image Generation},
author = {Yanjie Pan and Qingdong He and Zhengkai Jiang and Pengcheng Xu and Chaoyi Wang and Jinlong Peng and Haoxuan Wang and Yun Cao and Zhenye Gan and Mingmin Chi and Bo Peng and Yabiao Wang},
journal= {arXiv preprint arXiv:2503.06684},
year = {2026}
}