面向电商大规模多模态预训练的实例级表示学习
计算机视觉与模式识别
2023-04-07 v1
摘要
本文旨在建立一个通用的多模态基础模型,使其具备扩展至电商中海量下游应用的能力。近期,大规模视觉-语言预训练方法在通用领域取得了显著进展。然而,由于自然图像与商品图像之间存在显著差异,直接将这些用于建模图像级表示的框架应用于电商领域必然是次优的。为此,我们在本工作中提出了一种以实例为中心的多模态预训练范式,称为 ECLIP。具体而言,我们设计了一种解码器架构,引入了一组可学习的实例查询以显式聚合实例级语义。此外,为了使模型能够在不依赖昂贵人工标注的情况下聚焦于目标商品实例,我们进一步提出了两个专门配置的 pretext 任务。在 1 亿条电商相关数据上进行预训练后,ECLIP 成功提取了更具通用性、语义丰富且鲁棒的表示。大量实验结果表明,无需进一步微调,ECLIP 便在广泛的下游任务上大幅超越了现有方法,展示了对真实世界电商应用的强大可迁移性。
引用
@article{arxiv.2304.02853,
title = {Learning Instance-Level Representation for Large-Scale Multi-Modal Pretraining in E-commerce},
author = {Yang Jin and Yongzhi Li and Zehuan Yuan and Yadong Mu},
journal= {arXiv preprint arXiv:2304.02853},
year = {2023}
}
备注
16 pages, 10 figures, accepted by CVPR 2023