面向 AMR 文本生成可解释评估的可分解度量
计算与语言
2021-01-27 v3
摘要
从抽象意义表示(如 AMR)生成自然语言文本的系统通常使用自动表层匹配度量来评估,这些度量将生成文本与构建输入意义表示时所依据的参考文本进行比较。我们表明,除了此类度量固有的已知问题外,将其用于 AMR 到文本评估时还会出现一个额外问题,因为抽象意义表示允许大量表层实现方式。在这项工作中,我们旨在通过提出 来缓解这些问题,这是一种基于两大支柱的可分解度量。第一支柱是意义保持原则 :它衡量使用 SOTA AMR 解析器从生成句子中重建给定 AMR 的程度,并应用(细粒度)AMR 评估度量来度量原始 AMR 与重建 AMR 之间的距离。第二支柱基于(语法)形式原则 ,衡量生成文本的语言质量,我们使用 SOTA 语言模型来实现。在两项广泛的试点研究中,我们表明两大支柱的满足为 AMR 到文本评估带来益处,包括分数的可解释性。由于 不一定依赖黄金 AMR,它可能扩展到其他文本生成任务。
引用
@article{arxiv.2008.08896,
title = {Towards a Decomposable Metric for Explainable Evaluation of Text Generation from AMR},
author = {Juri Opitz and Anette Frank},
journal= {arXiv preprint arXiv:2008.08896},
year = {2021}
}
备注
EACL 2021