中文

FoodMLLM-JP:基于多模态大语言模型的日本菜谱生成

计算机视觉与模式识别 2025-03-04 v2 多媒体

摘要

利用菜谱数据进行食品图像理解的研究长期以来是焦点,因为该数据的多样性和复杂性。此外,食品与人们的生活密切相关,使其成为诸如饮食管理等实际应用中的重要研究领域。近期,多模态大语言模型(MLLMs)在其广泛知识储备以及自然语言处理能力方面展现出卓越的性能。尽管英语是主要使用的语言,但它们也支持包括日本语在内的多种语言。这表明,MLLMs有望在食品图像理解任务中显著提升性能。我们对开源 MLLMs LLaVA-1.5 和 Phi-3 Vision 在日本菜谱数据集上进行微调,并将其性能与封闭模型 GPT-4o 进行基准测试。随后,我们使用覆盖日本食品文化的 5000 个评估样本评估生成菜谱的内容,包括食材和烹饪步骤。我们的评估表明,针对菜谱数据进行训练的开源模型在食材生成方面优于 GPT-4o,即当前最先进的模型。我们的模型 achieved F1 分数为 0.531,超过 GPT-4o 的 F1 分数 0.481,表明准确率更高。此外,我们的模型在生成烹饪步骤文本方面也表现出与 GPT-4o 相当的性能。

关键词

引用

@article{arxiv.2409.18459,
  title  = {FoodMLLM-JP: Leveraging Multimodal Large Language Models for Japanese Recipe Generation},
  author = {Yuki Imajuku and Yoko Yamakata and Kiyoharu Aizawa},
  journal= {arXiv preprint arXiv:2409.18459},
  year   = {2025}
}

备注

15 pages, 5 figures. We found errors in the calculation of evaluation metrics, which were corrected in this version with $\color{blue}{\text{modifications highlighted in blue}}$. Please also see the Appendix