中文

MCEN:用潜变量模型弥合烹饪食谱与菜品图像间的跨模态鸿沟

计算机视觉与模式识别 2020-04-03 v1 计算与语言

摘要

如今,在饮食与健康关注日益增长的驱动下,食物计算已吸引工业界与学界的极大关注。该领域最热门的研究课题之一是食物检索,因其对面向健康的应用影响深远。本文聚焦于食物图像与烹饪食谱间的跨模态检索任务。我们提出模态一致嵌入网络(MCEN),通过将图像与文本投影至同一嵌入空间来学习模态不变表征。为捕捉模态间的潜在对齐,我们引入随机潜变量以显式利用文本与视觉特征间的交互。重要的是,我们的方法在训练时学习跨模态对齐,而在推理时独立计算不同模态的嵌入以保证效率。大量实验结果清晰表明,所提 MCEN 在基准 Recipe1M 数据集上优于所有现有方法,且计算开销更低。

关键词

引用

@article{arxiv.2004.01095,
  title  = {MCEN: Bridging Cross-Modal Gap between Cooking Recipes and Dish Images with Latent Variable Model},
  author = {Han Fu and Rui Wu and Chenghao Liu and Jianling Sun},
  journal= {arXiv preprint arXiv:2004.01095},
  year   = {2020}
}

备注

Accepted to CVPR 2020