中文

INSTRUCTSCORE:基于细粒度反馈的可解释文本生成评估

计算与语言 2023-10-30 v3 人工智能

摘要

自动评估语言生成的质量至关重要。尽管近期学习的度量指标与人类判断表现出高相关性,这些指标无法解释其判定或将分数与生成文本中的缺陷相关联。为应对这一局限,我们提出 InstructScore,一种用于文本生成的可解释评估度量。通过利用显式人类指令与 GPT-4 的隐式知识,我们基于 LLaMA 微调了一个文本评估度量,同时产出生成文本的分数与可读的诊断报告。我们在多种生成任务上评估 InstructScore,包括翻译、图像描述、数据到文本以及常识生成。实验表明,我们的 7B 模型超越了所有其他无监督度量,包括基于 175B GPT-3 和 GPT-4 的度量。令人惊讶的是,我们的 InstructScore 即使没有直接来自人类评分数据的监督,也达到了与 COMET22 等最先进度量相当的性能,而后者是在人类评分上微调的。

关键词

引用

@article{arxiv.2305.14282,
  title  = {INSTRUCTSCORE: Explainable Text Generation Evaluation with Finegrained Feedback},
  author = {Wenda Xu and Danqing Wang and Liangming Pan and Zhenqiao Song and Markus Freitag and William Yang Wang and Lei Li},
  journal= {arXiv preprint arXiv:2305.14282},
  year   = {2023}
}

备注

Accepted to EMNLP2023 Main Conference