面向更公平评测的 AMR 规范化
计算与语言
2019-12-10 v2
摘要
抽象语义表示(AMR;Banarescu 等人,2013)将句子的语义编码为有向图,而 Smatch(Cai 和 Knight,2013)是评测 AMR 图的主要指标。然而,Smatch 未能识别 AMR 规范所允许的某些语义等价但图结构不同的变体,并对呈现这些变体的 AMR 给出不同分数。本文提出四种规范化方法,以帮助确保概念等价的 AMR 被评测为等价。经过与未经规范化的等价 AMR 可能看起来截然不同——仅使用关系具体化将黄金语料与其自身比较就产生 25 个 Smatch 点的差异,这表明两个系统的输出在不经过规范化时可能无法直接比较。本文描述的算法基于现有的开源 Python AMR 工具包实现,并将以相同许可证发布。
引用
@article{arxiv.1909.01568,
title = {AMR Normalization for Fairer Evaluation},
author = {Michael Wayne Goodman},
journal= {arXiv preprint arXiv:1909.01568},
year = {2019}
}
备注
Updates: fixed errors in Figs 5--7; adjusted Fig 6 for clarity; added software version numbers; added acknowledgments; fix typo in bibliography