中文

CommerceMM:具备全能检索的大规模电商多模态表示学习

计算机视觉与模式识别 2022-02-16 v1 人工智能 计算与语言 多媒体 社会与信息网络

摘要

我们介绍 CommerceMM——一个多模态模型,能够对给定内容(图像、文本、图像+文本)相关的电商主题提供多样且细粒度的理解,并具备泛化到广泛任务的能力,包括多模态分类、图文检索、查询到商品检索、图像到商品检索等。我们遵循预训练+微调的训练范式,并提出 5 个针对图像-文本对的有效预训练任务。为接纳更常见且多样的具有文本到多模态、图像到多模态以及多模态到多模态映射的电商数据,我们提出另外 9 个新颖的跨模态与跨对检索任务,称为全能检索(Omni-Retrieval)预训练。预训练以高效方式进行,对组合的 14 个任务仅进行两次前向/反向更新。大量实验与分析显示了各任务的有效性。当组合所有预训练任务时,我们的模型在微调后于 7 个电商相关下游任务上取得最先进(state-of-the-art)性能。此外,我们提出一种新颖的模态随机化方法,以在不同效率约束下动态调整我们的模型。

关键词

引用

@article{arxiv.2202.07247,
  title  = {CommerceMM: Large-Scale Commerce MultiModal Representation Learning with Omni Retrieval},
  author = {Licheng Yu and Jun Chen and Animesh Sinha and Mengjiao MJ Wang and Hugo Chen and Tamara L. Berg and Ning Zhang},
  journal= {arXiv preprint arXiv:2202.07247},
  year   = {2022}
}

备注

10 pages, 7 figures. Commerce Multimodal Model towards Real Applications at Facebook