CoAScore:用于 NLG 评估的方面链提示
计算与语言
2023-12-19 v1
摘要
近年来,自然语言生成 (NLG) 评估已从单方面范式转向多方面范式,从而允许进行更准确的评估。大型语言模型 (LLM) 在各种 NLG 评估任务中取得了卓越的性能。然而,当前的工作通常使用 LLM 独立评估不同方面,这在很大程度上忽略了各个方面之间丰富的相关性。为了填补这一研究空白,在本工作中,我们提出了一种名为 CoAScore 的 NLG 评估指标。CoAScore 由 LLM 驱动,在评估特定方面的质量时,通过 CoA (\textbf{C}hain-\textbf{o}f-\textbf{A}spects,方面链) 提示框架利用多方面知识。具体而言,对于给定的待评估方面,我们首先提示 LLM 生成与目标方面相关且可能对评估有用的方面链。然后,我们收集每个生成方面的评估分数,最后利用这些方面的知识来改进对目标方面的评估。我们在五个 NLG 评估任务(例如,摘要、对话响应生成等)和九个方面(例如,整体质量、相关性、连贯性等)上对 CoAScore 进行了评估。我们的实验结果强调,与单方面评估相比,CoAScore 与人类判断表现出更高的相关性。无论是在评估整体质量还是其他方面,这一改进都显著优于现有的无监督评估指标。我们还进行了广泛的消融研究,以验证 CoAScore 框架内三个阶段的有效性,并进行了案例研究以展示 LLM 在这些阶段中的表现。我们的代码和脚本已公开。
引用
@article{arxiv.2312.10355,
title = {CoAScore: Chain-of-Aspects Prompting for NLG Evaluation},
author = {Peiyuan Gong and Jiaxin Mao},
journal= {arXiv preprint arXiv:2312.10355},
year = {2023}
}