中文

面向电商营销的基于扩散模型的保持物体ID的Human-object交互图像生成

计算机视觉与模式识别 2024-05-17 v1

摘要

由于大规模文本到图像生成通过扩散模型取得了显著进展,可控人类图像生成近年来受到广泛关注。现有工作如Controlnet[36]、T2I-adapter[20]和HumanSD[10]在基于姿态条件生成人类图像方面表现良好,但仍未满足实际电商场景的要求。具体包括:(1)所展示产品与人类的交互应予以考虑;(2)人类的面部/手部/手臂/脚部以及人类模型与产品之间的交互应具备高度逼真;(3)广告中展示的产品标识应与实际产品完全一致。为此,本文首先定义了新的电商营销人类图像生成任务,即Object-ID-retentive Human-object Interaction image Generation(OHG),随后提出VirtualModel框架用于生成展示产品的真实感人类图像,支持任意产品类别和任意类型的Human-object交互。如图1所示,VirtualModel不仅在准确姿态控制和图像质量方面优于其他方法,还能通过保持产品ID一致性并增强Human-object交互的可信度,实现用户指定产品对象的展示。代码和数据将予以发布。

关键词

引用

@article{arxiv.2405.09985,
  title  = {VirtualModel: Generating Object-ID-retentive Human-object Interaction Image by Diffusion Model for E-commerce Marketing},
  author = {Binghui Chen and Chongyang Zhong and Wangmeng Xiang and Yifeng Geng and Xuansong Xie},
  journal= {arXiv preprint arXiv:2405.09985},
  year   = {2024}
}

备注

project page: https://aigcdesigngroup.github.io/replace-anything;