中文

更好的 Smatch 等于更好的解析器?AMR 评测不再如此简单

计算与语言 2022-10-13 v1 人工智能

摘要

近来,以结构化的 Smatch 指标衡量,AMR 解析取得了惊人的进展。事实上,当今的系统达到了似乎超越人类标注者间一致性(IAA)估计的性能水平。因此,目前尚不清楚 Smatch(仍然)在多大程度上与人类对解析质量的估计相关,因为在这种情况下,权重相似的细粒度错误可能对 AMR 的含义产生不同程度的影响。我们对两个流行且强大的 AMR 解析器进行了分析,它们——根据 Smatch——达到了与人类 IAA 相当的质量水平,并评估人类质量评分与 Smatch 及其他 AMR 指标的关系。我们的主要发现是:i)尽管高 Smatch 分数暗示并非如此,我们发现 AMR 解析远未解决:我们经常发现结构上微小但语义上不可接受的错误,这些错误严重扭曲了句子含义。ii)考虑到高性能解析器,更好的 Smatch 分数未必表明始终如一的更好解析质量。为了获得对解析(器)质量差异的有意义且全面的评估,我们建议用宏统计、额外指标的使用以及更多人类分析来扩充评测。

关键词

引用

@article{arxiv.2210.06461,
  title  = {Better Smatch = Better Parser? AMR evaluation is not so simple anymore},
  author = {Juri Opitz and Anette Frank},
  journal= {arXiv preprint arXiv:2210.06461},
  year   = {2022}
}

备注

accepted at "Evaluation and Comparison of NLP Systems" Workshop (Eval4NLP 2022)