中文

电商领域知识感知的多模态预训练

计算机视觉与模式识别 2021-09-03 v1 人工智能 计算与语言

摘要

本文研究电商领域产品数据的多模态预训练。当前针对图像与文本模态提出的多模态预训练方法,在面对模态缺失和模态噪声时缺乏鲁棒性,而这两类是真实电商场景中多模态产品数据普遍存在的问题。为此,我们提出一种新方法 K3M,在多模态预训练中引入知识模态,以纠正图像和文本模态的噪声并补充其缺失。模态编码层提取各模态特征。模态交互层能够有效建模多模态交互,其中设计了初始交互特征融合模型以保持图像模态与文本模态的独立性,并设计了结构聚合模块以融合图像、文本和知识模态的信息。我们使用三个预训练任务对 K3M 进行预训练,包括掩码对象建模(MOM)、掩码语言建模(MLM)和链接预测建模(LPM)。在真实电商数据集及一系列基于产品的下游任务上的实验结果表明,在存在模态噪声或模态缺失时,K3M 的性能显著优于基线方法和 SOTA 方法。

关键词

引用

@article{arxiv.2109.00895,
  title  = {Knowledge Perceived Multi-modal Pretraining in E-commerce},
  author = {Yushan Zhu and Huaixiao Tou and Wen Zhang and Ganqiang Ye and Hui Chen and Ningyu Zhang and Huajun Chen},
  journal= {arXiv preprint arXiv:2109.00895},
  year   = {2021}
}

备注

Accepted to ACM MM 2021