AMBER:多属性抽取的自动监督
数据库
2012-10-23 v1
摘要
从深网中抽取多属性对象是非结构化网络与结构化数据之间的桥梁。现有方法要么从一组人工标注的页面中诱导包装器,要么在无监督情况下利用页面上的重复结构。前者缺乏自动化,后者缺乏准确性。因此,准确、自动的多属性对象抽取仍然是一个未解决的挑战。AMBER 通过重复结构与自动生成的标注之间的相互监督克服了这两个局限性。以往基于自动标注的方法由于标注中固有的噪声而质量低下,并试图通过探索多个候选包装器来弥补。相比之下,AMBER 通过将重复结构分析与基于标注的诱导相结合来补偿这种噪声:重复结构限制了包装器诱导的搜索空间,反之,标注使得重复结构分析能够区分噪声与相关数据。标注中的低召回率和低精度均得到缓解,从而实现了接近人工质量(超过 98%)的多属性对象抽取。为实现这一精度,AMBER 只需针对整个领域训练一次。AMBER 利用一小部分可能含有噪声的属性实例和该领域的几个未标注站点来引导其训练。
引用
@article{arxiv.1210.5984,
title = {AMBER: Automatic Supervision for Multi-Attribute Extraction},
author = {Tim Furche and Georg Gottlob and Giovanni Grasso and Giorgio Orsi and Christian Schallhart and Cheng Wang},
journal= {arXiv preprint arXiv:1210.5984},
year = {2012}
}