中文

基于自注意力与成分注意力的图像查询食谱检索模型

信息检索 2019-11-06 v1 计算与语言

摘要

由于食材的形变与遮挡,以及餐食类间的高类内相似性与低类间差异性,直接的基于计算机视觉的营养成分估计是一项艰巨任务。为应对这些问题,我们提出了一种从图像进行食谱检索的系统。随后可利用食谱信息估计餐食的营养成分。本研究使用了多模态 Recipe1M 数据集,其包含超过 100 万条食谱及超过 1300 万张图像。所提模型可作为自动营养估计流程的第一步,通过提供与食材和步骤相关的提示来实现。通过自注意力,模型可直接处理原始食谱文本,使上游指令句嵌入过程冗余,从而减少训练时间,同时提供理想的检索结果。此外,我们提出使用成分注意力机制,以洞察哪些指令、指令片段或单个指令词对处理某食谱中的单一食材至关重要。基于注意力的食谱文本编码通过聚焦于餐食特有的制备步骤,有助于解决高类内/低类间差异性问题。实验结果展示了此类图像食谱检索系统的潜力,并与两种基线方法进行了比较。

关键词

引用

@article{arxiv.1911.01770,
  title  = {Self-Attention and Ingredient-Attention Based Model for Recipe Retrieval from Image Queries},
  author = {Matthias Fontanellaz and Stergios Christodoulidis and Stavroula Mougiakakou},
  journal= {arXiv preprint arXiv:1911.01770},
  year   = {2019}
}

备注

MADiMa 2019,5th International Workshop on Multimedia Assisted Dietary Management