中文

基于聚类条件化的扩散模型用于食物图像生成

计算机视觉与模式识别 2023-09-04 v1 人工智能 机器学习

摘要

基于图像的饮食评估是一种高效且准确的解决方案,以进餐场景图像为输入来记录和分析营养摄入。基于深度学习的技术常用于执行图像分析,如食物分类、分割和份量估计,这些技术依赖于大量带标注的食物图像进行训练。然而,这种数据依赖性对实际应用构成了显著障碍,因为获取大量、多样且均衡的食物图像集可能具有挑战性。一个潜在的解决方案是使用合成食物图像进行数据增强。尽管已有工作探索了基于生成对抗网络(GAN)的结构进行生成,但合成食物图像的质量仍然欠佳。此外,虽然基于扩散的生成模型在通用图像生成任务中展现出有前景的结果,但由于类内差异显著,食物图像的生成仍具挑战性。本文研究了基于条件扩散模型的合成食物图像生成,并提出了一种有效的基于聚类的训练框架,名为 ClusDiff,用于生成高质量且具有代表性的食物图像。所提方法在 Food-101 数据集上进行了评估,与现有图像生成工作相比表现出改进的性能。我们还证明了 ClusDiff 生成的合成食物图像可帮助解决 VFN-LT 数据集中长尾食物分类的严重类别不平衡问题。

关键词

引用

@article{arxiv.2309.00199,
  title  = {Diffusion Model with Clustering-based Conditioning for Food Image Generation},
  author = {Yue Han and Jiangpeng He and Mridul Gupta and Edward J. Delp and Fengqing Zhu},
  journal= {arXiv preprint arXiv:2309.00199},
  year   = {2023}
}

备注

Accepted for 31st ACM International Conference on Multimedia: 8th International Workshop on Multimedia Assisted Dietary Management (MADiMa 2023)