中文

AMR 到英语生成系统的人类评估

计算与语言 2020-12-02 v2

摘要

当前大多数从抽象意义表示(AMR)生成英语文本的顶尖系统仅使用自动化指标(如 BLEU)进行评估,而这些指标在自然语言生成中被认为存在问题。在本工作中,我们呈现了一项新人类评估的结果,该评估为若干近期 AMR 生成系统收集了流畅度与充分性评分,以及错误类型分类。我们讨论了这些系统的相对质量,以及我们的结果与自动指标结果的比较,发现尽管这些指标在系统整体排序上大多成功,但收集人类判断可进行更细致的比较。我们还分析了这些系统所犯的常见错误。

关键词

引用

@article{arxiv.2004.06814,
  title  = {A Human Evaluation of AMR-to-English Generation Systems},
  author = {Emma Manning and Shira Wein and Nathan Schneider},
  journal= {arXiv preprint arXiv:2004.06814},
  year   = {2020}
}

备注

COLING 2020