LLaVA-Chef:用于美食食谱的多模态生成模型
计算与语言
2024-09-02 v1 机器学习
摘要
在全球化背景下在线食谱分享快速演变的格局中,对理解和生成美食食谱的研究出现了显著激增。大型语言模型(LLMs)如GPT-2和LLaVA的最新进展为自然语言处理(NLP)方法深入探讨与食物相关任务的各个方面铺平了道路,包括食材识别和全面的食谱生成。尽管LLMs具有令人印象深刻的性能和多模态适应性,但特定领域的训练对于其有效应用仍然至关重要。这项工作评估了现有的LLMs在食谱生成方面的能力,并提出了LLaVA-Chef,这是一种通过多阶段方法在精选的多样化食谱提示数据集上训练的新模型。首先,我们改进了视觉食物图像嵌入到语言空间的映射。其次,我们通过在相关食谱数据上微调LLaVA,使其适应食物领域。第三,我们利用多样化的提示来增强模型的食谱理解能力。最后,我们通过使用自定义损失函数惩罚模型,提高了生成食谱的语言质量。LLaVA-Chef相较于预训练LLMs和先前的工作展示出显著的改进。详细的定性分析表明,与现有方法相比,LLaVA-Chef能生成包含精确食材提及的更详细的食谱。
引用
@article{arxiv.2408.16889,
title = {LLaVA-Chef: A Multi-modal Generative Model for Food Recipes},
author = {Fnu Mohbat and Mohammed J. Zaki},
journal= {arXiv preprint arXiv:2408.16889},
year = {2024}
}