中文

使用扩散模型在大规模图像重情境化中保持产品忠实度

计算机视觉与模式识别 2025-03-13 v1 人工智能 机器学习

摘要

我们提出了一种基于文本到图像扩散模型和新颖数据增强管道的框架,用于高保真产品图像重情境化。该管道利用图像到视频扩散、内部/外部填充和负面方法创建合成训练数据,解决了现实世界数据收集的局限性。我们的方法通过解耦产品表示并增强模型对产品特征的理解,提高了生成图像的质量和多样性。在 ABO 数据集和一个私有产品数据集上进行评估,使用自动化指标和人类评估,证明了该框架在生成真实且引人注目的产品可视化方面的有效性,具有广泛的应用前景,如电子商务和虚拟产品展示。

关键词

引用

@article{arxiv.2503.08729,
  title  = {Preserving Product Fidelity in Large Scale Image Recontextualization with Diffusion Models},
  author = {Ishaan Malhi and Praneet Dutta and Ellie Talius and Sally Ma and Brendan Driscoll and Krista Holden and Garima Pruthi and Arunachalam Narayanaswamy},
  journal= {arXiv preprint arXiv:2503.08729},
  year   = {2025}
}