关系三元组抽取90%的F1分数:真实可信吗?
计算与语言
2023-10-30 v2
摘要
从文本中抽取关系三元组是构建知识库的关键任务。联合实体与关系抽取模型的最新进展在从自由文本中准确抽取关系三元组方面展现出卓越的F1分数(≥90%)。然而,这些模型在受限的实验设置与不真实的数据集下被评估,忽略了零三元组(零基数)的句子,从而简化了任务。本文中,我们在更真实的设置下对最先进的联合实体与关系抽取模型进行了基准研究。我们在实验中纳入缺乏任何三元组的句子,以提供全面评估。我们的发现揭示,在该真实实验设置下,模型的F1分数显著下降(在一个数据集中约降10-15%,另一数据集中降6-14%)。此外,我们提出一种利用简单基于BERT分类器的两步建模方法,该方法在这些模型于真实实验设置下带来了整体性能提升。
引用
@article{arxiv.2302.09887,
title = {90% F1 Score in Relational Triple Extraction: Is it Real ?},
author = {Pratik Saini and Samiran Pal and Tapas Nayak and Indrajit Bhattacharya},
journal= {arXiv preprint arXiv:2302.09887},
year = {2023}
}
备注
Accepted in GenBench workshop @ EMNLP 2023