中文

ViscoNet:桥接并协调视觉与文本条件以用于ControlNet

计算机视觉与模式识别 2024-09-05 v2 人工智能

摘要

本文介绍ViscoNet,一种用于并发空间和视觉条件的新型单分支适配器架构。我们的轻量级模型所需的可训练参数和数据集大小比当前最先进的IP-Adapter小数个数量级。然而,我们的方法成功保留了冻结的文本到图像(T2I)骨干网络的生成能力。值得注意的是,它在解决模式崩溃这一先前被忽视的普遍问题方面表现出色。我们的新颖架构在实现和谐的视觉-文本平衡方面展示了卓越的能力,在各种人类图像生成任务中释放了无与伦比的多功能性,包括姿态重定向、虚拟试穿、风格化、行人重识别和纹理迁移。演示和代码可从项目页面https://soon-yau.github.io/visconet/获取。

关键词

引用

@article{arxiv.2312.03154,
  title  = {ViscoNet: Bridging and Harmonizing Visual and Textual Conditioning for ControlNet},
  author = {Soon Yau Cheong and Armin Mustafa and Andrew Gilbert},
  journal= {arXiv preprint arXiv:2312.03154},
  year   = {2024}
}