M5Product:面向电子商务多模态预训练的自协调对比学习
计算机视觉与模式识别
2022-04-05 v5 多媒体
摘要
尽管多模态预训练具有从互补数据模态中学习高度判别性特征表示的潜力,但当前进展因缺乏大规模模态多样的数据集而放缓。利用电子商务中不同模态捕获互补语义信息的天然适用性,我们贡献了一个大规模多模态预训练数据集 M5Product。该数据集包含 5 种模态(图像、文本、表格、视频和音频),涵盖超过 6,000 个类别和 5,000 个属性,比具有相似模态数量的最大公开可用数据集大 500 倍。此外,M5Product 包含不完整的模态对和噪声,同时具有长尾分布,类似于大多数现实世界问题。我们进一步提出了自协调对比学习(SCALE),这是一种新颖的预训练框架,通过自适应特征融合机制将不同模态集成到统一模型中,其中每种模态的重要性直接从模态嵌入中学习,并影响多模态 Transformer 模型内的模态间对比学习和掩码任务。我们评估了当前多模态预训练的最先进方法,并基准测试了它们在面临 M5Product 数据集中大量模态时从无标签数据中学习的能力。我们在四个下游任务上进行了广泛实验,并展示了我们 SCALE 模型的优越性,为数据集规模和多样性的重要性提供了见解。
引用
@article{arxiv.2109.04275,
title = {M5Product: Self-harmonized Contrastive Learning for E-commercial Multi-modal Pretraining},
author = {Xiao Dong and Xunlin Zhan and Yangxin Wu and Yunchao Wei and Michael C. Kampffmeyer and Xiaoyong Wei and Minlong Lu and Yaowei Wang and Xiaodan Liang},
journal= {arXiv preprint arXiv:2109.04275},
year = {2022}
}
备注
CVPR2022