SemBleu:一种用于AMR解析评估的鲁棒度量
计算与语言
2019-05-31 v2
摘要
评估AMR解析准确性涉及比较成对的AMR图。主要评估度量SMATCH(Cai and Knight, 2013)使用贪心爬山算法搜索两个AMR节点间的一一映射,这会导致搜索错误。我们提出SEMBLEU,一种将BLEU(Papineni et al., 2002)扩展到AMR的鲁棒度量。它不受搜索错误影响,且除局部对应外还考虑非局部对应。SEMBLEU完全由内容驱动,并惩罚系统输出未从输入中保留大部分信息的情况。在句子和语料库层面的初步实验表明,SEMBLEU与人工判断的一致性略高于SMATCH。我们的代码可在 http://github.com/freesunshine0316/sembleu 获取。
引用
@article{arxiv.1905.10726,
title = {SemBleu: A Robust Metric for AMR Parsing Evaluation},
author = {Linfeng Song and Daniel Gildea},
journal= {arXiv preprint arXiv:1905.10726},
year = {2019}
}
备注
ACL 2019 camera ready