超越相关性分析的 NLG 评价指标:一个经验性指标偏好检查表
计算与语言
2023-05-29 v4
摘要
在本研究中,我们分析自然语言生成(NLG)的自动评价指标,具体为任务无关指标和类人对齐指标。任务无关指标(如 Perplexity、BLEU、BERTScore)成本低且高度适应多样的 NLG 任务,但它们与人的相关性较弱。类人对齐指标(CTC、CtrlEval、UniEval)通过将期望的类人特质作为训练目标来提升相关性水平。然而,它们在辨别系统级性能和系统输出质量方面的有效性仍不清楚。我们提出指标偏好检查表,作为一个在三个 NLG 任务中评估自动指标有效性的框架:文本摘要、对话响应生成和受控生成。我们提出的框架提供如下途径:(i) 用于验证自动指标是否忠实于人类偏好,无论其与人类的相关性水平如何;(ii) 用于通过成对评估检视 NLG 系统的优势与局限。我们表明,在文本摘要和受控生成任务中,自动指标比人类更能指导系统级性能的区分。我们还表明,多方面类人对齐指标(UniEval)未必优于单方面类人对齐指标(CTC、CtrlEval)和任务无关指标(BLEU、BERTScore),尤其在受控生成任务中。
引用
@article{arxiv.2305.08566,
title = {NLG Evaluation Metrics Beyond Correlation Analysis: An Empirical Metric Preference Checklist},
author = {Iftitahu Ni'mah and Meng Fang and Vlado Menkovski and Mykola Pechenizkiy},
journal= {arXiv preprint arXiv:2305.08566},
year = {2023}
}
备注
To appear at ACL 2023 Toronto (main conference). 9 pages (main), 1 page for Limitations and Ethics, 11 pages for Appendix