中文

检索增强的食谱生成

计算机视觉与模式识别 2024-12-12 v2

摘要

鉴于从食物图像生成食谱的潜在应用,该领域近年来引起了研究人员的广泛关注。现有的食谱生成工作主要采用两阶段训练方法,首先生成食材,然后从图像和食材中获取制作说明。大型多模态模型(LMMs)在各种视觉和语言任务中取得了显著成功,为直接从图像生成食材和制作说明提供了可能。然而,LMMs在食谱生成过程中仍然面临常见的幻觉问题,导致性能欠佳。为了解决这个问题,我们提出了一种用于食谱生成的检索增强型大型多模态模型。我们首先引入了随机多样化检索增强(SDRA),从现有数据存储中检索与图像语义相关的食谱作为补充,将它们整合到提示中,为输入图像添加多样且丰富的上下文。此外,还提出了自一致性集成投票机制,以确定最可信的预测食谱作为最终输出。它计算使用不同检索食谱作为生成上下文的候选生成食谱之间的一致性。大量实验验证了我们提出方法的有效性,在Recipe1M数据集上的食谱生成任务中展示了最先进的(SOTA)性能。

关键词

引用

@article{arxiv.2411.08715,
  title  = {Retrieval Augmented Recipe Generation},
  author = {Guoshan Liu and Hailong Yin and Bin Zhu and Jingjing Chen and Chong-Wah Ngo and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2411.08715},
  year   = {2024}
}

备注

ACCEPT on IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2025