中文

面向电商属性的大规模生成式多模态属性抽取

计算机视觉与模式识别 2023-06-02 v1 机器学习

摘要

电商网站(如Amazon)的产品页面上存在大量结构化与非结构化信息(文本与图像)。卖家往往不为其产品标注属性值(如颜色、尺寸等)或标注错误。从包含文本与图像的电商产品页面中自动识别这些属性值是一项具有挑战性的任务,尤其当属性值未在商品目录中明确提及之时。本文针对该问题提出一种可扩展解决方案,将属性抽取问题建模为问答任务,并采用由三个关键组件构成的\textbf{MXT}求解: (i) \textbf{M}AG(多模态适配门,Multimodal Adaptation Gate),(ii) \textbf{X}ception网络,以及 (iii) \textbf{T}5编码器-解码器。我们的系统由一个生成模型组成,该模型利用产品的文本与视觉特征(如图像)来\emph{生成}给定产品的属性值。我们表明,我们的系统能够处理零样本属性预测(训练数据中未出现的属性值)与值缺失预测(文本中未提及的属性值),而这两点分别正是传统基于分类与基于NER的模型所缺失的。我们使用远程监督训练模型,摆脱了对人工标注的依赖,从而使其适用于现实应用。借助该框架,我们能为数千个(产品类型,属性)对训练单一模型,由此降低了训练与维护独立模型的开销。在两份真实世界数据集上的大量实验表明,我们的框架相较现有SOTA模型将绝对recall@90P分别提升了10.16%与6.9%。在一家知名电商商店中,我们已为数千个(产品类型,属性)对部署了我们的模型。

关键词

引用

@article{arxiv.2306.00379,
  title  = {Large Scale Generative Multimodal Attribute Extraction for E-commerce Attributes},
  author = {Anant Khandelwal and Happy Mittal and Shreyas Sunil Kulkarni and Deepak Gupta},
  journal= {arXiv preprint arXiv:2306.00379},
  year   = {2023}
}

备注

ACL 2023 Industry Track, 8 Pages