中文

基于指代消解的自然语言理解评估的有效性

计算与语言 2026-02-19 v1

摘要

本论文通过扩充现有评估实践并考察评估结果是收敛还是冲突来细化我们对从指代消解评估中得出哪些结论的理解。在分析标准指代消解评估后发现,其设计常常导致不可推广的结论,原因在于测量有效性问题——包括争议性(指代的多种、竞争性定义)和收敛有效性(评估结果在不同基准测试中对模型排名不同)。其次,我提出并实现了一种新颖评估,聚焦于测试系统推断事件相对合理性的能力——这是解决指代消解的关键方面。通过这一扩展评估,我发现当代语言模型在标准基准测试上表现强劲——在特定领域和指代类型上均超越了早期基线系统——但在评估条件上仍具脆弱性:当评估情境稍微修改时,模型往往未能实现人类所能实现的泛化。综上,这些发现既明确了当前 NLP 范式的优势,如在广泛使用的评估上准确率提升,又指出了其局限——包括测量有效性薄弱问题——并为未来开发更好评估方法和更具普适性的系统指明了方向。

关键词

引用

@article{arxiv.2602.16200,
  title  = {The Validity of Coreference-based Evaluations of Natural Language Understanding},
  author = {Ian Porada},
  journal= {arXiv preprint arXiv:2602.16200},
  year   = {2026}
}

备注

PhD Thesis