深度图像到食谱翻译
计算机视觉与模式识别
2024-07-02 v1 计算与语言
机器学习
摘要
现代格言“你就是你吃的东西”在深层次上引发共鸣,体现了我们身份与所消费食物之间的深刻联系。我们的项目——深度图像到食谱翻译——是计算机视觉与自然语言生成交汇的领域,旨在搭建心爱的食物记忆与烹饪创作之间的鸿沟。我们的主要目标是从给定的食物图像中预测食材。为此,我们首先开发了自定义卷积网络,然后将其性能与采用迁移学习的模型进行比较。我们还追求从食材列表中生成综合性的食谱步骤。我们将此过程建模为序列到序列任务,开发了使用预训练词嵌入的循环神经网络。我们解决了深度学习中的若干挑战,包括数据不平衡、数据清洗、过拟合和超参数选择。我们的做法强调了诸如交并比(IoU)和 F1 分数等指标的重要性,这些指标在准确率alone 可能误导的情况下尤为关键。对于我们的食谱预测模型,我们采用困惑度(perplexity),这是语言模型中常用且重要的指标。我们发现,通过预训练 ResNet-50 权重和 GloVe 嵌入进行迁移学习能为模型性能带来显著提升,尤其在考虑训练资源限制时效果更为突出。尽管我们在图像到食谱翻译方面取得了进展,但在模型架构、数据集规模和用户交互方面的进步仍有潜在的探索空间。
引用
@article{arxiv.2407.00911,
title = {Deep Image-to-Recipe Translation},
author = {Jiangqin Ma and Bilal Mawji and Franz Williams},
journal= {arXiv preprint arXiv:2407.00911},
year = {2024}
}