利用基础模型增强食谱检索:一种数据增强视角
信息检索
2024-07-18 v2
摘要
在共同嵌入空间中学习食谱与食物图像的表示并非易事,但对于跨模态食谱检索至关重要。本文中,我们通过利用基础模型进行数据增强,为此问题提出了一种新视角。借助基础模型(即Llama2和SAM)的卓越能力,我们提出通过提取与对应模态相关的可对齐信息来增强食谱和食物图像。具体而言,Llama2用于从食谱生成文本描述,旨在捕捉食物图像的视觉线索,而SAM则用于生成与食谱中关键食材对应的图像分割块。为充分利用增强数据,我们引入了数据增强检索框架(DAR),以增强跨模态检索的食谱与图像表示学习。我们首先向预训练的CLIP模型注入适配器层以降低计算成本,而非完全微调所有参数。此外,提出了多层级圆形损失来对齐原始与增强数据对,该损失对正负样本对分配不同的惩罚。在Recipe1M数据集上,我们的DAR以大幅优势超越了所有现有方法。广泛的消融研究验证了DAR每个组件的有效性。
引用
@article{arxiv.2312.04763,
title = {Enhancing Recipe Retrieval with Foundation Models: A Data Augmentation Perspective},
author = {Fangzhou Song and Bin Zhu and Yanbin Hao and Shuo Wang},
journal= {arXiv preprint arXiv:2312.04763},
year = {2024}
}
备注
ECCV2024