中文

LaTeX-Numeric:面向电商数值属性的语言无关文本属性抽取框架

机器学习 2021-04-26 v2

摘要

本文提出 LaTeX-Numeric——一个高精度、全自动、可扩展的框架,用于从产品描述等产品文本中抽取电商数值属性。以往多数属性抽取工作依赖人工标注的训练数据(无论是否使用主动学习),因而不可扩展。我们采用远程监督生成训练数据,摆脱了对人工标签的依赖。远程监督的一个问题是,匹配时因属性值缺失会导致训练标注不完整。我们提出一种多任务学习架构以应对训练数据中的标签缺失,使数值属性的 F1 较单任务架构提升 9.2%。尽管多任务架构对数值与非数值属性均有裨益,我们仍给出自动化技术以进一步提升数值属性抽取模型。数值属性需要一组单位(或别名)以更好地与远程监督匹配。我们提出一种利用产品文本与属性值自动生成别名的算法,带来 20.2% 的 F1 提升。在涵盖 5 个产品类别、3 个英语市场的 20 个数值属性真实数据集上的大量实验表明,LaTeX-Numeric 无需任何人工干预即取得高 F1 分数,适合实际应用。最后,我们展示了改进与语言无关,LaTeX-Numeric 在 3 种罗曼语上取得 13.9% 的 F1 提升。

关键词

引用

@article{arxiv.2104.09576,
  title  = {LaTeX-Numeric: Language-agnostic Text attribute eXtraction for E-commerce Numeric Attributes},
  author = {Kartik Mehta and Ioana Oprea and Nikhil Rasiwasia},
  journal= {arXiv preprint arXiv:2104.09576},
  year   = {2021}
}

备注

NAACL 2021 Industry Track