CommerceMM:具备全能检索的大规模电商多模态表示学习
计算机视觉与模式识别
2022-02-16 v1 人工智能
计算与语言
多媒体
社会与信息网络
摘要
我们介绍 CommerceMM——一个多模态模型,能够对给定内容(图像、文本、图像+文本)相关的电商主题提供多样且细粒度的理解,并具备泛化到广泛任务的能力,包括多模态分类、图文检索、查询到商品检索、图像到商品检索等。我们遵循预训练+微调的训练范式,并提出 5 个针对图像-文本对的有效预训练任务。为接纳更常见且多样的具有文本到多模态、图像到多模态以及多模态到多模态映射的电商数据,我们提出另外 9 个新颖的跨模态与跨对检索任务,称为全能检索(Omni-Retrieval)预训练。预训练以高效方式进行,对组合的 14 个任务仅进行两次前向/反向更新。大量实验与分析显示了各任务的有效性。当组合所有预训练任务时,我们的模型在微调后于 7 个电商相关下游任务上取得最先进(state-of-the-art)性能。此外,我们提出一种新颖的模态随机化方法,以在不同效率约束下动态调整我们的模型。
引用
@article{arxiv.2202.07247,
title = {CommerceMM: Large-Scale Commerce MultiModal Representation Learning with Omni Retrieval},
author = {Licheng Yu and Jun Chen and Animesh Sinha and Mengjiao MJ Wang and Hugo Chen and Tamara L. Berg and Ning Zhang},
journal= {arXiv preprint arXiv:2202.07247},
year = {2022}
}
备注
10 pages, 7 figures. Commerce Multimodal Model towards Real Applications at Facebook