PAM:跨产品类目属性抽取中对商品图像的理解
计算机视觉与模式识别
2021-06-10 v1 计算与语言
机器学习
摘要
理解商品属性对提升客户在线购物体验具有重要作用,并是构建商品知识图谱的组成部分。现有多数方法侧重于从文本描述中抽取属性,或利用商品图像的视觉信息如形状和颜色。相较于先前工作所考虑的输人,商品图像实际上包含更多信息,由精心设计的版式中的文字与视觉线索的丰富混合所表示,以给客户留下印象。本文提出一个更包容的框架,充分利用这些不同模态进行属性抽取。受视觉问答近期工作的启发,我们使用基于 transformer 的序列到序列模型来融合商品文本、光学字符识别(OCR)词元以及商品图像中检测到的视觉对象的表示。该框架通过训练解码器预测产品类目与属性值并将输出以产品类目为条件,进一步扩展为可使用单一模型跨多个产品类目抽取属性值的能力。该模型提供了一种统一的属性抽取方案,适用于提供众多产品类目及多样化商品属性的电商平台。我们在 14 个产品类目上针对两个商品属性(一个具有多个可能值,一个具有少量可能值)评估了模型,发现相较于使用仅文本特征的现有方法,模型在召回率上可获得 15% 的提升,在 F1 分数上可获得 10% 的提升。
引用
@article{arxiv.2106.04630,
title = {PAM: Understanding Product Images in Cross Product Category Attribute Extraction},
author = {Rongmei Lin and Xiang He and Jie Feng and Nasser Zalmout and Yan Liang and Li Xiong and Xin Luna Dong},
journal= {arXiv preprint arXiv:2106.04630},
year = {2021}
}
备注
KDD 2021