中文

通过无需训练的掩码引导扩散增强视觉控制下的提示遵循

计算机视觉与模式识别 2024-04-24 v1

摘要

近年来,将视觉控制集成到文本到图像(T2I)模型中(例如 ControlNet 方法)因具备更精细的控制能力而受到广泛关注。尽管各种无需训练的方法努力增强 T2I 模型中的提示遵循,但视觉控制的问题仍然鲜少被研究,尤其是在视觉控制与文本提示不对齐的场景中。本文解决了“视觉控制下的提示遵循”这一挑战,并提出了一种名为掩码引导提示遵循的无需训练方法。引入对象掩码以区分视觉控制和提示中对齐与不对齐的部分。同时,设计了一个被称为 Masked ControlNet 的网络,利用这些对象掩码在不对齐的视觉控制区域进行对象生成。此外,为了改善属性匹配,设计了一种简单而有效的损失函数,以将属性注意力图与由 ControlNet 和对象掩码约束的对象区域对齐。通过全面的定量和定性实验验证了 MGPF 的有效性和优越性。

关键词

引用

@article{arxiv.2404.14768,
  title  = {Enhancing Prompt Following with Visual Control Through Training-Free Mask-Guided Diffusion},
  author = {Hongyu Chen and Yiqi Gao and Min Zhou and Peng Wang and Xubin Li and Tiezheng Ge and Bo Zheng},
  journal= {arXiv preprint arXiv:2404.14768},
  year   = {2024}
}