中文

可扩展的电商文本属性归一化方法 (SANTA)

计算与语言 2021-06-18 v1 机器学习

摘要

在本文中,我们提出 SANTA,一个可自动将电商属性值(如“Win 10 Pro”)归一化到一组预定义规范值(如“Windows 10”)的可扩展框架。先前关于属性归一化的工作聚焦于模糊字符串匹配(本文亦称为句法匹配)。在本工作中,我们首先对九种句法匹配算法进行了广泛研究,并确定“余弦”相似度能取得最佳结果,较常用的 Jaccard 指数提升 2.7%。接着,我们指出仅依靠字符串相似度不足以完成属性归一化,因为许多表层形式需要超越句法匹配(例如“720p”与“HD”为同义词)。尽管无监督嵌入(如 word2vec/fastText)等语义技术在词相似度任务中表现良好,但我们观察到它们难以区分相近的规范形式,因为这些相近形式常出现在相似语境中。我们提出使用带三元组损失(triplet loss)的双生网络(twin network)学习词元嵌入。我们提出了一种利用原始属性值与商品标题以自监督方式学习这些嵌入的嵌入学习任务。我们表明,使用我们提出的任务提供监督,在属性归一化上优于基于句法匹配与无监督嵌入的技术。在包含 50 个属性的真实世界属性归一化数据集上的实验表明,采用我们所提方法训练的嵌入相较最佳字符串匹配提升 2.3%,相较最佳无监督嵌入提升 19.3%。

关键词

引用

@article{arxiv.2106.09493,
  title  = {Scalable Approach for Normalizing E-commerce Text Attributes (SANTA)},
  author = {Ravi Shankar Mishra and Kartik Mehta and Nikhil Rasiwasia},
  journal= {arXiv preprint arXiv:2106.09493},
  year   = {2021}
}

备注

Accepted in ECNLP workshop of ACL-IJCNLP 2021 (https://sites.google.com/view/ecnlp)