中文

DEE:面向文本生成的双阶段可解释评估方法

计算与语言 2024-03-19 v1

摘要

由于生成系统的应用日益广泛,评估机器生成文本的自动方法具有重要意义。传统方法往往缺乏可解释性,仅给出一个单一的数值分数来表示评估结果。近期的进展试图通过引入大型语言模型(LLMs)来提供更详细的错误分析以缓解这一局限,但其适用性仍然受限,尤其是在全面错误覆盖和快速检测至关重要的工业场景中。为缓解这些挑战,我们提出DEE,一种用于评估文本生成质量的双阶段可解释评估方法。DEE基于Llama 2构建,遵循由阶段特定指令引导的双阶段原则,在初始阶段高效识别生成文本中的错误,随后在第二阶段深入提供全面的诊断报告。DEE在我们精心构建的数据集AntEval上进行了微调,该数据集包含来自支付宝四个使用生成系统的实际应用中的15K个示例。该数据集涉及幻觉和毒性等新出现的问题,从而拓宽了DEE的评估标准范围。实验结果证实了DEE相对于现有评估方法的优越性,在人类相关性以及效率方面均取得了显著提升。

关键词

引用

@article{arxiv.2403.11509,
  title  = {DEE: Dual-stage Explainable Evaluation Method for Text Generation},
  author = {Shenyu Zhang and Yu Li and Rui Wu and Xiutian Huang and Yongrui Chen and Wenhao Xu and Guilin Qi},
  journal= {arXiv preprint arXiv:2403.11509},
  year   = {2024}
}

备注

Accepted by DASFAA 2024