结合语言模型与图模型进行 Web 半结构化信息抽取
信息检索
2024-02-23 v1 计算与语言
摘要
关系抽取是挖掘 Web 上海量人类知识的有效方式。现有方法依赖于特定领域的训练数据或产生噪声输出。我们在此专注于仅给定关系的简短描述,从半结构化网页中提取目标关系。我们提出了 GraphScholarBERT,一种基于联合图与语言模型结构的开放域信息抽取方法。GraphScholarBERT 无需额外数据或训练即可泛化至先前未见过的领域,并仅产生与搜索关键词匹配的干净抽取结果。实验表明,在零样本领域和零样本网站设置下,GraphScholarBERT 的抽取 F1 分数较前人工作提升了高达 34.8\%。
引用
@article{arxiv.2402.14129,
title = {Combining Language and Graph Models for Semi-structured Information Extraction on the Web},
author = {Zhi Hong and Kyle Chard and Ian Foster},
journal= {arXiv preprint arXiv:2402.14129},
year = {2024}
}
备注
7 pages, 2 figures