中文

通过统一学习方案与动态范围最小化提升多模态电商属性值抽取

计算机视觉与模式识别 2023-04-07 v2 计算与语言 多媒体

摘要

随着电子商务行业的繁荣,视觉与语言等多种模态被用于描述商品。理解此类多样化数据是一项巨大挑战,尤其是借助有益的图像区域从文本序列中抽取属性-值对。尽管一系列先前工作致力于该任务,仍存在鲜被研究的障碍阻碍进一步提升:1)来自上游单模态预训练的参数未得到充分应用,未在下游多模态任务中进行恰当的联合微调。2)为选取图像的描述性部分,广泛采用简单的后期融合,忽视了语言相关信息应由更强编码器编码至通用语言嵌入空间的先验知识。3)由于商品间的多样性,其属性集差异巨大,但当前方法以不必要的最大范围进行预测,导致更多潜在假阳性。为解决这些问题,本文提出一种通过统一学习方案与动态范围最小化来提升多模态电商属性值抽取的新方法:1)首先,设计统一方案以利用预训练单模态参数联合训练多模态任务。2)其次,提出文本引导的信息范围最小化方法,以强大预训练语言模型自适应地将各模态的描述性部分编码至同一空间。3)此外,提出原型引导的属性范围最小化方法,先确定当前商品的恰当属性集,再选取原型引导所选属性的预测。在流行多模态电商基准上的实验表明,我们的方法优于其他最先进技术。

关键词

引用

@article{arxiv.2207.07278,
  title  = {Boosting Multi-Modal E-commerce Attribute Value Extraction via Unified Learning Scheme and Dynamic Range Minimization},
  author = {Mengyin Liu and Chao Zhu and Hongyu Gao and Weibo Gu and Hongfa Wang and Wei Liu and Xu-cheng Yin},
  journal= {arXiv preprint arXiv:2207.07278},
  year   = {2023}
}