为文本到图像生成学习连续 3D 词
计算机视觉与模式识别
2024-02-14 v1
摘要
当前用于图像生成的扩散模型控制方法(例如通过文本或 ControlNet)在识别抽象、连续的属性(如光照方向或非刚性形状变化)方面存在不足。在本文中,我们提出了一种方法,允许文本到图像模型用户对图像中的多个属性进行细粒度控制。我们通过设计一组可以连续变换的特殊输入 token 来实现这一点——我们将其称为连续 3D 词。例如,这些属性可以表示为滑块,并与文本提示联合应用,以对图像生成进行细粒度控制。仅给定单一网格和渲染引擎,我们展示了我们的方法可被用于提供对多种 3D 感知属性的连续用户控制,包括一天中不同时间的光照、鸟类翅膀朝向、滑动变焦效果和物体姿态。我们的方法能够同时使用多个连续 3D 词和文本描述作为图像生成的条件,且不会增加生成过程的开销。项目页面:https://ttchengab.github.io/continuous_3d_words
引用
@article{arxiv.2402.08654,
title = {Learning Continuous 3D Words for Text-to-Image Generation},
author = {Ta-Ying Cheng and Matheus Gadelha and Thibault Groueix and Matthew Fisher and Radomir Mech and Andrew Markham and Niki Trigoni},
journal= {arXiv preprint arXiv:2402.08654},
year = {2024}
}
备注
Project Page: https://ttchengab.github.io/continuous_3d_words