面向跨模态食物检索的视觉与结构化语言预训练
计算机视觉与模式识别
2023-03-17 v2 机器学习
摘要
视觉-语言预训练(VLP)和基础模型已成为在通用基准上取得 SOTA 性能的常规方法。然而,将这些强大技术用于更复杂的视觉-语言任务(如烹饪应用),且输入数据更具结构化,仍鲜有研究。本工作中,我们提出将这些技术用于基于结构化文本的计算烹饪任务。我们的策略称为 VLPCook,首先将现有的图像-文本对转换为图像与结构化文本对。这允许我们使用适应所得数据集结构化数据的 VLP 目标来预训练 VLPCook 模型,然后在下游计算烹饪任务上对其进行微调。在微调期间,我们还丰富了视觉编码器,利用预训练的基础模型(如 CLIP)提供局部和全局文本上下文。VLPCook 在大型 Recipe1M 数据集的跨模态食物检索任务上以显著优势(Recall@1 绝对提升 +3.3)超越当前 SOTA。我们进一步在 VLP 上开展实验以验证其重要性,特别是在 Recipe1M+ 数据集上。最后,我们验证了该方法对其他任务(即食物识别)以及具有结构化文本的领域(如 ROCO 数据集上的医学领域)的泛化能力。代码可在此获取:https://github.com/mshukor/VLPCook
引用
@article{arxiv.2212.04267,
title = {Vision and Structured-Language Pretraining for Cross-Modal Food Retrieval},
author = {Mustafa Shukor and Nicolas Thome and Matthieu Cord},
journal= {arXiv preprint arXiv:2212.04267},
year = {2023}
}
备注
Code: https://github.com/mshukor/VLPCook