中文

SmartControl: 增强 ControlNet 以处理粗糙视觉条件

计算机视觉与模式识别 2024-04-10 v1

摘要

人类的视觉想象通常始于类比或粗略草图。例如,给定一张女孩在建筑前弹吉他的图片,人们可以类比想象钢铁侠在埃及金字塔前弹吉他的样子。然而,视觉条件可能与文本提示所指示的想象结果不完全对齐,现有的布局可控文本到图像(T2I)生成模型容易产生带有明显伪影的退化生成结果。为了解决这个问题,我们提出了一种名为 SmartControl 的新型 T2I 生成方法,旨在修改粗糙的视觉条件以适应文本提示。SmartControl 的关键思想是放松与文本提示冲突区域的视觉条件。具体来说,我们设计了一个控制尺度预测器(CSP)来识别冲突区域并预测局部控制尺度,同时构建了一个包含文本提示和粗糙视觉条件的数据集用于训练 CSP。值得注意的是,即使只有有限数量(例如 1000~2000)的训练样本,我们的 SmartControl 也能很好地泛化到未见过的物体。在四种典型视觉条件类型上的大量实验清楚地表明了我们的 SmartControl 相对于最先进方法的有效性。源代码、预训练模型和数据集可在 https://github.com/liuxiaoyu1104/SmartControl 获取。

关键词

引用

@article{arxiv.2404.06451,
  title  = {SmartControl: Enhancing ControlNet for Handling Rough Visual Conditions},
  author = {Xiaoyu Liu and Yuxiang Wei and Ming Liu and Xianhui Lin and Peiran Ren and Xuansong Xie and Wangmeng Zuo},
  journal= {arXiv preprint arXiv:2404.06451},
  year   = {2024}
}