中文

基于有限标注数据学习的电商目录文本属性值自动校验

计算与语言 2020-06-24 v3 机器学习

摘要

产品目录是电商网站的宝贵资源。在目录中,一个产品关联多个属性,其值为短文本,如产品名、品牌、功能和口味。通常各零售商自行上报这些关键值,因此目录信息不可避免地包含噪声事实。尽管现有深度神经网络模型在两段文本间交叉校验方面已取得成功,但其成功必须依赖大量高质量标注数据,而在此校验任务中由于产品横跨众多类别,难以获取此类数据。为应对上述挑战,我们提出一种新颖的元学习潜变量方法,称为 MetaBridge,它可从具有有限标注数据的类别子集中学习可迁移知识,并利用无标注数据捕捉未见类别的不确定性。更具体地,我们做出如下贡献:(1) 我们将来自众多类别的产品文本属性值校验问题形式化为少样本学习设定下的自然语言推理任务,并提出一种元学习潜变量模型来联合处理从产品档案与文本属性值中获取的信号。(2) 我们提出将元学习与潜变量整合于统一模型中,以有效捕捉各类别的不确定性。(3) 我们提出一种基于少样本学习设定下潜变量模型的新颖目标函数,其确保无标注与有标注数据间分布一致性,并通过从所学分布中采样防止过拟合。在来自数百类别的真实电商数据集上的大量实验证明了 MetaBridge 在文本属性校验上的有效性及其相较于 SOTA 方法的优异性能。

关键词

引用

@article{arxiv.2006.08779,
  title  = {Automatic Validation of Textual Attribute Values in E-commerce Catalog by Learning with Limited Labeled Data},
  author = {Yaqing Wang and Yifan Ethan Xu and Xian Li and Xin Luna Dong and Jing Gao},
  journal= {arXiv preprint arXiv:2006.08779},
  year   = {2020}
}

备注

KDD 2020