中文

网页中的超文本实体抽取

计算与语言 2024-03-05 v1 人工智能

摘要

网页实体抽取是研究和应用中的一项基础自然语言处理任务。如今,大多数网页实体抽取模型都是在结构化数据集上训练的,这些数据集努力保留文本内容及其结构信息。然而,现有数据集都忽略了丰富的超文本特征(例如字体颜色、字体大小),而这些特征在先前的工作中已显示出其有效性。为此,我们首先从电子商务领域收集了一个超文本实体抽取数据集(HEED),抓取了文本和相应的显式超文本特征,并带有高质量的人工实体标注。此外,我们提出了基于 MoE 的实体抽取框架(MoEEF),该框架通过混合专家模型高效集成多种特征以增强模型性能,并优于强基线,包括最先进的小规模模型和 GPT-3.5-turbo。此外,还分析了 HEED 中超文本特征的有效性以及 MoEEF 中几个模型组件的有效性。

关键词

引用

@article{arxiv.2403.01698,
  title  = {Hypertext Entity Extraction in Webpage},
  author = {Yifei Yang and Tianqiao Liu and Bo Shao and Hai Zhao and Linjun Shou and Ming Gong and Daxin Jiang},
  journal= {arXiv preprint arXiv:2403.01698},
  year   = {2024}
}