Foodfusion:一种通过扩散模型进行食物图像构图的新方法
计算机视觉与模式识别
2024-11-04 v2
摘要
食物图像构图需要使用现有菜品图像和背景图像来合成自然的新图像,而扩散模型在图像生成方面已取得显著进展,使我们能够构建具有前景景象的结果的端到端架构。然而,现有的扩散模型在处理和融合来自多个图像的信息方面面临挑战,同时缺乏可获得的高质量公共数据集,这些数据集阻碍了扩散模型在食物图像构图中的应用。在本文中,我们引入了一个大规模、高质量的食物图像合成数据集 FC22k,其中包含 22,000 个前景、背景和真实值三元图像对。此外,我们提出了一种新的食物图像构图方法 Foodfusion,该方法利用预训练扩散模型的能力并包含用于处理和集成前景和背景信息的融合模块。这种融合信息通过合并去噪 UNet 的交叉注意力层中的全局结构信息来将前景特征与背景结构对齐。为了进一步增强背景的内容和结构,我们还集成了内容-结构控制模块。广泛的实验表明,我们提出的方法的有效性和可扩展性。
引用
@article{arxiv.2408.14135,
title = {Foodfusion: A Novel Approach for Food Image Composition via Diffusion Models},
author = {Chaohua Shi and Xuan Wang and Si Shi and Xule Wang and Mingrui Zhu and Nannan Wang and Xinbo Gao},
journal= {arXiv preprint arXiv:2408.14135},
year = {2024}
}
备注
14 pages