中文

从网页中提取产品规格——超越表格与列表

信息检索 2022-01-11 v1 机器学习

摘要

网页上的电子商务产品页面通常以结构化表格块呈现产品规格数据。这些产品属性—值规格的提取已惠及产品目录整理、搜索、问答等应用。然而,在不同网站之间,通常用于渲染这些块的各种 HTML 元素(如 <table>、<ul>、<div>、<span>、<dl> 等)使得其自动提取成为一项挑战。当前大多数研究集中于从表格和列表中提取产品规格,因此在大规模提取场景下存在召回率不足的问题。在本文中,我们提出了一种超越表格或列表并泛化到用于渲染规格块的各种不同 HTML 元素的产品规格提取方法。结合手工编码特征与深度学习的空间及词元特征,我们首先识别产品页面上的规格块。随后,受包装器归纳启发,我们从这些块中提取产品属性—值对。我们创建了一个标注数据集,包含从 14,111 个不同规格块中提取的产品规格,这些块取自一系列不同的产品网站。我们的实验表明了该方法相较于当前规格提取模型的有效性,并支持了关于其可应用于大规模产品规格提取的主张。

关键词

引用

@article{arxiv.2201.02896,
  title  = {Extraction of Product Specifications from the Web -- Going Beyond Tables and Lists},
  author = {Govind Krishnan Gangadhar and Ashish Kulkarni},
  journal= {arXiv preprint arXiv:2201.02896},
  year   = {2022}
}

备注

9 pages, 7 figures, 9th ACM IKDD CODS and 27th COMAD