中文

ChefFusion:集成食谱与食物图像生成的多模态基础模型

计算机视觉与模式识别 2024-09-19 v1

摘要

在食物计算领域已进行大量工作,但这些研究通常仅聚焦于单一任务,如t2t(从食物标题和原料生成指令)、i2t(从食物图像生成食谱)或t2i(从食谱生成食物图像)。现有方法均未实现多模态集成。为填补这一空白,我们引入一种新型食物计算基础模型,实现真正的多模态性,涵盖t2t、t2i、i2t、it2t和t2ti等任务。通过利用大型语言模型(LLMs)和预训练的图像编码器与解码器,我们的模型能够完成多种食物计算相关任务,包括食物理解、食物识别、食谱生成和食物图像生成。与先前模型相比,我们的基础模型具备更广泛的能力,尤其在食物图像生成和食谱生成任务中表现出优异性能。我们已在GitHub开源ChefFusion。

关键词

引用

@article{arxiv.2409.12010,
  title  = {ChefFusion: Multimodal Foundation Model Integrating Recipe and Food Image Generation},
  author = {Peiyu Li and Xiaobao Huang and Yijun Tian and Nitesh V. Chawla},
  journal= {arXiv preprint arXiv:2409.12010},
  year   = {2024}
}