中文

FIRE:从食物图像到食谱生成

计算机视觉与模式识别 2024-05-14 v2 计算与语言

摘要

食物计算近年来已成为一个突出的多学科研究领域。食物计算的一个雄心勃勃的目标是开发能够自主为食物图像生成食谱信息的端到端智能系统。当前的图像到食谱方法基于检索,其成功严重依赖于数据集规模与多样性以及所学嵌入的质量。与此同时,强大的基于注意力的视觉与语言模型的出现为准确且可泛化的食谱生成提供了有前景的途径,但尚未得到广泛探索。本文提出FIRE,一种专为食物计算领域食谱生成定制的新型多模态方法,它基于输入的食物图像生成食物标题、食材和烹饪指令。FIRE利用BLIP模型生成标题,使用带解码器的Vision Transformer进行食材提取,并采用T5模型以标题和食材作为输入来生成食谱。我们展示了两个可受益于将FIRE与大型语言模型提示相结合的实用应用:将食谱定制以适应用户偏好,以及食谱到代码的转换以实现自动化烹饪过程。我们的实验结果验证了所提方法的有效性,突显了其在食物计算中未来进展和广泛采用的潜力。

关键词

引用

@article{arxiv.2308.14391,
  title  = {FIRE: Food Image to REcipe generation},
  author = {Prateek Chhikara and Dhiraj Chaurasia and Yifan Jiang and Omkar Masur and Filip Ilievski},
  journal= {arXiv preprint arXiv:2308.14391},
  year   = {2024}
}

备注

Published at IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) -- 2024