中文

TIGERScore:面向构建适用于所有文本生成任务的可解释评测指标

计算与语言 2024-05-13 v4 人工智能

摘要

我们提出 TIGERScore,一个遵循指令引导的经训练指标(Trained metric following Instruction Guidance to perform Explainable, and Reference-free evaluation),可对广泛的文本生成任务执行可解释且无参考的评测。与其他仅提供晦涩分数的自动评测方法不同,TIGERScore 由自然语言指令引导,提供错误分析以精确定位生成文本中的错误。我们的指标基于 LLaMA-2,在我们精心构建的指令微调数据集 MetricInstruct 上训练,该数据集涵盖 6 个文本生成任务和 23 个文本生成数据集。数据集由 42K 个四元组构成,形式为(指令,输入,系统输出 → 错误分析)。我们通过来自大量不同模型的“系统输出”收集,以覆盖不同类型的错误。为定量评估我们的指标,我们在 5 个held-in 数据集和 2 个 held-out 数据集上评估其与人类评分的相关性,并表明 TIGERScore 在这些数据集上能实现开源 SoTA 的人类评分相关性,且几乎接近 GPT-4 评测器。作为无参考指标,其相关性甚至可超越现有最佳的有参考指标。为进一步定性评估我们的指标所生成的基本原理,我们对生成的解释进行了人工评估,发现解释准确率为 70.8%。通过这些实验结果,我们相信 TIGERScore 展示了构建通用可解释指标以评测任意文本生成任务的可能性。所有资源已发布于我们的项目网站:\url{https://tiger-ai-lab.github.io/TIGERScore/}。

关键词

引用

@article{arxiv.2310.00752,
  title  = {TIGERScore: Towards Building Explainable Metric for All Text Generation Tasks},
  author = {Dongfu Jiang and Yishan Li and Ge Zhang and Wenhao Huang and Bill Yuchen Lin and Wenhu Chen},
  journal= {arXiv preprint arXiv:2310.00752},
  year   = {2024}
}