面向电子商务的多模态属性抽取
计算机视觉与模式识别
2022-03-08 v1 计算与语言
机器学习
机器学习
摘要
为改善用户在在线市场海量选项中浏览时的体验,拥有组织良好的产品目录至关重要。其中一个关键要素是产品属性(如颜色或材质)的可用性。然而,在我们所关注的乐天市场(Rakuten-Ichiba)等某些市场上,属性信息常常不完整甚至缺失。一个有前景的解决方案是依赖在大规模语料上预训练的深度模型,从非结构化数据(如产品描述文本和图像,本文中称为模态)中预测属性。然而,我们发现以该方法取得令人满意的性能并非易事,而是若干改进的结果,本文对此进行讨论。我们详细描述了属性抽取方法,从研究强力的单模态方法,到构建结合文本与视觉信息的稳健多模态模型。我们多模态架构的一个关键组成部分是一种受单模态研究启发、可无缝融合模态的新方法。实践中,我们注意到这种新的模态融合方法可能存在模态坍缩问题,即忽略某一模态。因此,我们进一步提出基于一种有原则的正则化方案来缓解该问题。在乐天市场数据上的实验为我们的方法之优势提供了经验证据,该方法也已成功部署至乐天市场。我们还报告了在公开可用数据集上的结果,表明我们的模型相较于若干近期多模态与单模态基线具有竞争力。
引用
@article{arxiv.2203.03441,
title = {Multi-Modal Attribute Extraction for E-Commerce},
author = {Aloïs De la Comble and Anuvabh Dutt and Pablo Montalvo and Aghiles Salah},
journal= {arXiv preprint arXiv:2203.03441},
year = {2022}
}