中文

超越数字:关系抽取基准创建与排行榜的透明性

计算与语言 2024-11-11 v1

摘要

本文研究了自然语言处理中基准创建和排行榜使用的透明性,重点关注关系抽取(RE)任务。现有的 RE 基准往往缺乏充分的文档记录,缺少关键细节,如数据来源、标注者间一致性、用于数据集实例选择的算法,以及关于潜在偏差(如数据集不平衡)的信息。RE 领域的进展通常通过排行榜来衡量,这些排行榜基于评估方法对系统进行排名,通常仅限于 F1-score 等聚合指标。然而,这些指标之外的详细性能分析的缺失可能会掩盖模型的真实泛化能力。我们的分析揭示,广泛使用的 RE 基准(如 TACRED 和 NYT)往往高度不平衡且包含噪声标签。此外,缺乏基于类别的性能指标无法准确反映模型在拥有大量关系类型的数据集上的表现。在报告 RE 进展时应仔细考虑这些局限性。虽然我们的讨论聚焦于 RE 基准和排行榜的透明性,但我们所讨论的观察广泛适用于其他 NLP 任务。本文并非削弱现有 RE 基准和新模型开发的重要性和价值,而是倡导改进文档记录和更严格的评估以推动该领域发展。

关键词

引用

@article{arxiv.2411.05224,
  title  = {Beyond the Numbers: Transparency in Relation Extraction Benchmark Creation and Leaderboards},
  author = {Varvara Arzt and Allan Hanbury},
  journal= {arXiv preprint arXiv:2411.05224},
  year   = {2024}
}

备注

This paper was accepted at the GenBench workshop at EMNLP2024