TXtract:面向数千产品类别的分类法感知知识抽取
计算与语言
2020-05-04 v2 信息检索
机器学习
机器学习
摘要
从产品档案中抽取结构化知识对于电子商务中的各类应用至关重要。现有的最优知识抽取方法均针对单一产品类别设计,因而无法适用于现实电子商务场景中常包含数千种多样化类别的情况。本文提出 TXtract,一种分类法感知的知识抽取模型,可应用于按层次化分类法组织的数千个产品类别。通过类别条件自注意力与多任务学习,我们的方法兼具可扩展性(为数千类别训练单一模型)与有效性(抽取类别特定的属性值)。在包含 4000 个类别的分类法产品上的实验表明,TXtract 在所有类别上的 F1 值和覆盖率分别比最优方法最高高出 10% 和 15%。
引用
@article{arxiv.2004.13852,
title = {TXtract: Taxonomy-Aware Knowledge Extraction for Thousands of Product Categories},
author = {Giannis Karamanolakis and Jun Ma and Xin Luna Dong},
journal= {arXiv preprint arXiv:2004.13852},
year = {2020}
}
备注
Accepted to ACL 2020 (Long Paper)