中文

面向半结构化 Web 文档属性抽取的标签高效自训练方法

信息检索 2022-08-30 v1 机器学习

摘要

从 HTML 文档中抽取结构化信息是一个被长期研究的问题,具有广泛的应用,包括知识库构建、分面搜索与个性化推荐。先前的工作依赖来自每个目标网站的少量人工标注网页,或来自若干种子网站的数千个人工标注网页,来训练一个可在未见目标网站上泛化的可迁移抽取模型。噪声内容、低站点级一致性以及标注者间一致性缺乏,使得网页标注成为耗时且昂贵的难题。我们提出 LEAST——一种面向半结构化 Web 文档的标签高效自训练 (Label-Efficient Self-Training) 方法,以克服这些局限。LEAST 利用少量人工标注页面来对来自目标垂直领域的大量未标注网页进行伪标注。它通过自训练在人工标注与伪标注样本上训练一个可迁移的 Web 抽取模型。为缓解由噪声训练样本导致的错误传播,LEAST 根据每个训练样本的估计标签准确率对其重新加权并纳入训练。据我们所知,这是首项提出仅利用少量人工标注页面训练可迁移 Web 抽取模型的端到端训练的工作。在大规模公开数据集上的实验表明,使用来自每个种子网站的少于十个人工标注页面进行训练,LEAST 训练的模型在未见网站上的平均 F1 分数超过先前 state-of-the-art 26 分以上,将达成相似性能所需的人工标注页面数量减少 10 倍以上。

关键词

引用

@article{arxiv.2208.13086,
  title  = {Label-Efficient Self-Training for Attribute Extraction from Semi-Structured Web Documents},
  author = {Ritesh Sarkhel and Binxuan Huang and Colin Lockard and Prashant Shiralkar},
  journal= {arXiv preprint arXiv:2208.13086},
  year   = {2022}
}