中文

结合语言模型与图模型进行 Web 半结构化信息抽取

信息检索 2024-02-23 v1 计算与语言

摘要

关系抽取是挖掘 Web 上海量人类知识的有效方式。现有方法依赖于特定领域的训练数据或产生噪声输出。我们在此专注于仅给定关系的简短描述,从半结构化网页中提取目标关系。我们提出了 GraphScholarBERT,一种基于联合图与语言模型结构的开放域信息抽取方法。GraphScholarBERT 无需额外数据或训练即可泛化至先前未见过的领域,并仅产生与搜索关键词匹配的干净抽取结果。实验表明,在零样本领域和零样本网站设置下,GraphScholarBERT 的抽取 F1 分数较前人工作提升了高达 34.8\%。

关键词

引用

@article{arxiv.2402.14129,
  title  = {Combining Language and Graph Models for Semi-structured Information Extraction on the Web},
  author = {Zhi Hong and Kyle Chard and Ian Foster},
  journal= {arXiv preprint arXiv:2402.14129},
  year   = {2024}
}

备注

7 pages, 2 figures