中文

InteractDiffusion:文本到图像扩散模型中的交互控制

计算机视觉与模式识别 2024-02-28 v2 图形学 多媒体

摘要

大规模文本到图像(T2I)扩散模型在基于文本描述生成连贯图像方面展现了令人难以置信的能力,从而在内容生成中实现了广泛应用。尽管最近的进展引入了对物体定位、姿态和图像轮廓等因素的控制,但在控制生成内容中物体之间的交互方面仍存在关键空白。在生成图像中良好控制交互可以产生有意义的应用,例如创建具有交互角色的真实场景。本文研究了用人物交互(HOI)信息(包括三元组标签(人物、动作、物体)和对应边界框)条件化T2I扩散模型的问题。我们提出了一种可插拔的交互控制模型,称为InteractDiffusion,它扩展了现有的预训练T2I扩散模型,使其能够更好地以交互为条件。具体来说,我们将HOI信息进行token化,并通过交互嵌入学习它们之间的关系。训练一个条件自注意力层将HOI token映射到视觉token,从而更好地在现有T2I扩散模型中条件化视觉token。我们的模型能够在现有T2I扩散模型上控制交互和位置,在HOI检测分数以及FID和KID保真度方面大幅超越现有基线。项目页面:https://jiuntian.github.io/interactdiffusion。

关键词

引用

@article{arxiv.2312.05849,
  title  = {InteractDiffusion: Interaction Control in Text-to-Image Diffusion Models},
  author = {Jiun Tian Hoe and Xudong Jiang and Chee Seng Chan and Yap-Peng Tan and Weipeng Hu},
  journal= {arXiv preprint arXiv:2312.05849},
  year   = {2024}
}

备注

Website: https://jiuntian.github.io/interactdiffusion. Accepted at CVPR2024