中文

面向多源优惠信息流混合命名实体识别系统

信息检索 2019-06-12 v2 机器学习

摘要

网络上的数据大多是非结构化的。银行、数字钱包、商户等多个来源发布的优惠信息,是当今世界上被访问最多的广告数据之一。这些数据每天被数百万人访问,且易于被人理解,但由于其高度非结构化且多样,使用算法从这些优惠中提取有意义的信息十分困难。从这些优惠中识别关键的优惠实体(例如金额、优惠适用的产品、提供优惠的商户等)对于定向触达正确客户以提升销售起着至关重要的作用。本工作提出并评估了多种现有的命名实体识别器(Named Entity Recognizer, NER)模型,这些模型能够从优惠信息流中识别所需实体。我们还提出了一种新颖的混合NER模型,其由第一层的条件随机场、双向LSTM和Spacy模型以及第二层的SVM分类器通过两级堆叠构建而成。所提出的混合模型已在从多个来源收集的优惠信息流上进行了测试,与现有模型相比,在优惠领域表现出更优的性能。

关键词

引用

@article{arxiv.1901.08406,
  title  = {Hybrid NER System for Multi-Source Offer Feeds},
  author = {Anusha Holla and Bharat Gaind and Vikas Reddy Katta and Abhishek Kundu and S Kamalesh},
  journal= {arXiv preprint arXiv:1901.08406},
  year   = {2019}
}

备注

Published in the Global Journal of Engineering Science and Researches (ISSN 2348 - 8034, Pg. 69-77) after getting accepted in the International Conference on Recent Trends In Computational Engineering and Technologies (ICRTCET'18), May 17-18, 2018, Bengaluru, India. Journal Link - http://www.gjesr.com/ICRTCET-18.html