FoodFusion:用于逼真食物图像生成的潜在扩散模型
计算机视觉与模式识别
2023-12-07 v1
摘要
当前最先进的图像生成模型,如潜在扩散模型,已经证明了生成视觉上引人注目的食物相关图像的能力。然而,这些生成的图像通常表现出一种艺术或超现实的特质,偏离了真实世界食物表示的真实性。这种不足使得它们在需要逼真食物图像的应用中变得不切实际,例如训练用于基于图像的膳食评估的模型。为了解决这些局限性,我们引入了 FoodFusion,这是一种专门为从文本描述忠实合成逼真食物图像而设计的潜在扩散模型。FoodFusion 模型的开发涉及利用广泛的开源食物数据集,产生了超过 300,000 个精选的图像-文本对。此外,我们提出并采用了两种不同的数据清洗方法,以确保生成的图像-文本对保持真实性和准确性。由此训练的 FoodFusion 模型在生成食物图像方面表现出卓越的能力,与公开可用的图像生成模型相比,在真实性和多样性方面均有显著提升。我们在 https://bit.ly/genai4good 公开分享数据集和微调后的模型,以支持食物图像合成这一关键领域的进步。
引用
@article{arxiv.2312.03540,
title = {FoodFusion: A Latent Diffusion Model for Realistic Food Image Generation},
author = {Olivia Markham and Yuhao Chen and Chi-en Amy Tai and Alexander Wong},
journal= {arXiv preprint arXiv:2312.03540},
year = {2023}
}