中文

基于 Transformer 的大批量训练跨模态菜谱嵌入

计算机视觉与模式识别 2022-12-19 v2

摘要

本文提出一种跨模态菜谱检索框架,即基于 Transformer 的大批量训练网络(TNLBT),其受 ACME(对抗跨模态嵌入)与 H-T(层次化 Transformer)启发。TNLBT 旨在完成检索任务的同时由菜谱嵌入生成图像。我们采用基于层次化 Transformer 的菜谱文本编码器、基于 Vision Transformer(ViT)的菜谱图像编码器以及对抗网络架构,以实现菜谱文本与图像更好的跨模态嵌入学习。此外,我们利用自监督学习挖掘无对应图像的菜谱文本中的丰富信息。由于近期自监督学习文献指出对比学习可受益于更大批量,我们训练时采用大批量并验证了其有效性。实验中,所提框架在基准 Recipe1M 上的跨模态菜谱检索与图像生成任务均显著优于当前最先进框架。这是首项证实大批量训练对跨模态菜谱嵌入有效性的工作。

关键词

引用

@article{arxiv.2205.04948,
  title  = {Transformer-based Cross-Modal Recipe Embeddings with Large Batch Training},
  author = {Jing Yang and Junwen Chen and Keiji Yanai},
  journal= {arXiv preprint arXiv:2205.04948},
  year   = {2022}
}

备注

Accepted at MMM2023