中文

新闻网站多记录网页信息提取

计算与语言 2025-02-21 v1 信息检索

摘要

本文聚焦于从包含大量记录的网页中提取信息的任务,这一任务在大规模网页数据时代日益重要。近年来,神经网络方法的发展提高了从网页中提取信息的质量。然而,大多数研究和数据集旨在研究详细页面,导致多记录'列表页面'相对缺乏研究,尽管它们广泛存在且具有实际意义。为填补这一空白,我们构建了一个大规模、公开可访问的数据集,专为列表页面设计。这是首个针对该任务的俄语语言数据集。该数据集包含13,120个新闻列表网页,规模和复杂度显著超过现有数据集。数据集包含各种类型的属性,包括可选和多值属性,提供了真实世界列表页面的真实呈现。这些特征使我们的数据集成为研究从包含大量记录的页面中提取信息的宝贵资源。此外,我们提出了自己的多阶段信息提取方法。本文探索并展示了将MarkupLM应用于多记录网页特定挑战的多种策略。我们的实验验证了我们方法的优势。通过公开发布我们的数据集,我们旨在推动从多记录页面中提取信息领域的发展。

关键词

引用

@article{arxiv.2502.14625,
  title  = {Multi-Record Web Page Information Extraction From News Websites},
  author = {Alexander Kustenkov and Maksim Varlamov and Alexander Yatskov},
  journal= {arXiv preprint arXiv:2502.14625},
  year   = {2025}
}