基于分层 Transformer 与自监督学习改进跨模态菜谱检索
计算机视觉与模式识别
2021-03-25 v1
摘要
跨模态菜谱检索近年来受到了广泛关注,这归因于食物在人们生活中的重要性,以及大量数字烹饪菜谱和食物图像可用于训练机器学习模型。在本工作中,我们重新审视现有的跨模态菜谱检索方法,并提出了一种基于成熟且高性能的文本与图像编码器的简化端到端模型。我们引入了一种分层菜谱 Transformer,可注意力式地编码各个菜谱组成部分(标题、食材和步骤)。此外,我们提出了一种在成对菜谱组成部分之上计算的自监督损失函数,该函数能够利用菜谱内部的语义关系,并支持使用图像-菜谱以及仅菜谱样本进行训练。我们进行了深入的分析与消融实验以验证我们的设计选择。结果表明,我们所提出的方法在 Recipe1M 数据集上的跨模态菜谱检索任务中达到了最先进的性能。我们公开了代码与模型。
引用
@article{arxiv.2103.13061,
title = {Revamping Cross-Modal Recipe Retrieval with Hierarchical Transformers and Self-supervised Learning},
author = {Amaia Salvador and Erhan Gundogdu and Loris Bazzani and Michael Donoser},
journal= {arXiv preprint arXiv:2103.13061},
year = {2021}
}
备注
CVPR 2021