跨模态检索与合成(X-MRS):在共享表示学习中弥合模态鸿沟
计算机视觉与模式识别
2021-10-01 v3 信息检索
机器学习
摘要
计算食物分析(CFA)天然需要特定食物的多模态证据,例如图像、菜谱文本等。使CFA成为可能的关键在于多模态共享表示学习,其旨在为数据的多视图(文本与图像)创建联合表示。本工作提出一种面向食物领域跨模态共享表示学习的方法,保留食物数据中丰富的语义信息。我们提出的方法采用基于 transformer 的多语言菜谱编码器与传统图像嵌入架构相结合。在此,我们提出利用不完美的多语言翻译来有效正则化模型,同时为跨多种语言与字母体系的功能提供支持。在公开Recipe1M数据集上的实验分析表明,所提方法学习到的表示在检索任务上显著优于当前最优(SOTA)方法。此外,通过学习到的表示在以菜谱嵌入为条件的生成式食物图像合成模型中展示了其表征能力。合成图像能有效复现配对样本的视觉外观,表明所学表示捕获了文本菜谱与其视觉内容的联合语义,从而缩小了模态鸿沟。
引用
@article{arxiv.2012.01345,
title = {Cross-Modal Retrieval and Synthesis (X-MRS): Closing the Modality Gap in Shared Representation Learning},
author = {Ricardo Guerrero and Hai Xuan Pham and Vladimir Pavlovic},
journal= {arXiv preprint arXiv:2012.01345},
year = {2021}
}