OpenTag:从产品档案中开放抽取属性值
计算与语言
2018-10-09 v2 人工智能
信息检索
机器学习
摘要
缺失属性值的抽取是从自由文本输入中寻找描述某关注属性的取值。过去大多数关于缺失属性值抽取的相关工作都基于封闭世界假设,即可能取值集合事先已知,或使用取值词典与人工设计特征。我们如何能发现前所未见的新属性值?我们能否在有限人工标注或监督下完成此事?我们在产品目录这一背景下研究该问题,此类目录中许多关注属性常存在缺失值。本工作中,我们利用产品档案信息(如标题与描述)来发现产品属性的缺失值。我们针对该抽取问题提出了一种新颖的深度标注模型 OpenTag,其贡献如下:(1)我们将问题形式化为序列标注任务,并提出一种联合模型,利用循环神经网络(具体为双向 LSTM)捕捉上下文与语义,利用条件随机场(CRF)保证标注一致性;(2)我们提出一种新颖的注意力机制,为模型决策提供可解释说明;(3)我们提出一种探索主动学习的新型采样策略,以减轻人工标注负担。OpenTag 不使用任何词典或如先前工作般的人工设计特征。在多个不同领域的真实数据集上的大量实验表明,采用主动学习策略的 OpenTag 仅从少至 150 个标注样本中(标注工作量减少 3.3 倍)即以 83% 的高 F 值发现新属性值,优于当前最优模型。
引用
@article{arxiv.1806.01264,
title = {OpenTag: Open Attribute Value Extraction from Product Profiles [Deep Learning, Active Learning, Named Entity Recognition]},
author = {Guineng Zheng and Subhabrata Mukherjee and Xin Luna Dong and Feifei Li},
journal= {arXiv preprint arXiv:1806.01264},
year = {2018}
}
备注
Proceedings of the 24th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining, London, UK, August 19-23, 2018