TextEE:事件抽取中的基准、再评估、反思与未来挑战
计算与语言
2024-06-07 v3
摘要
事件抽取因广泛应用而备受关注。然而,近期研究指出了评估问题,表明所报告分数可能未能准确反映真实性能。本工作中,我们识别并解决评估挑战,包括由不同数据假设或预处理步骤导致的不一致、当前评估框架的不足可能引入数据集或数据划分偏差,以及部分先前方法的可复现性低。为应对这些挑战,我们提出 TextEE,一个标准化、公平且可复现的事件抽取基准。TextEE 包含针对涵盖八个多样领域的 16 个数据集的标准化数据预处理脚本与划分,并纳入 14 种近期方法,开展全面基准再评估。我们还在 TextEE 基准上评估了五种不同大语言模型,展示它们如何难以取得满意性能。受再评估结果和发现的启发,我们讨论了事件抽取在当前 NLP 时代的角色,以及源自 TextEE 的未来挑战与见解。我们相信 TextEE 作为首个标准化综合基准工具,将显著推动未来事件抽取研究。
引用
@article{arxiv.2311.09562,
title = {TextEE: Benchmark, Reevaluation, Reflections, and Future Challenges in Event Extraction},
author = {Kuan-Hao Huang and I-Hung Hsu and Tanmay Parekh and Zhiyu Xie and Zixuan Zhang and Premkumar Natarajan and Kai-Wei Chang and Nanyun Peng and Heng Ji},
journal= {arXiv preprint arXiv:2311.09562},
year = {2024}
}
备注
Paper accepted by ACL 2024 Findings