中文

从大语言模型学习序列生成的评测模型

计算与语言 2025-06-27 v3

摘要

序列生成的自动评测传统上依赖于 BLEU 和 ROUGE 等指标,由于其强调 n-gram 重叠,往往无法捕捉生成文本序列的语义准确性。解决此问题的一个有前景的方案是开发基于模型的指标,如 BLEURT 和 COMET。然而,这些方法通常受限于标注评测数据的稀缺性,而训练评测模型需要此类数据。在这项工作中,我们针对这一挑战提出定制序列评测指标(CSEM),一种三阶段评测模型训练方法,利用大语言模型生成标注数据以开发基于模型的指标,从而消除对人工标注数据的需求。此外,我们扩展了 CSEM 的适用范围以支持各类评测类型,包括单方面、多方面、无参考和有参考评测,使得指标可定制以适应多样的现实场景。在 SummEval 基准上的实验结果表明,CSEM 能够在不使用人工标注数据的情况下有效训练评测模型。在强化学习和重排序中的进一步实验表明,通过 CSEM 开发的指标优于传统评测指标,按常用指标和 ChatGPT 的评测均带来序列质量的显著提升。

关键词

引用

@article{arxiv.2308.04386,
  title  = {Learning Evaluation Models from Large Language Models for Sequence Generation},
  author = {Chenglong Wang and Hang Zhou and Kaiyan Chang and Tongran Liu and Chunliang Zhang and Quan Du and Tong Xiao and Yue Zhang and Jingbo Zhu},
  journal= {arXiv preprint arXiv:2308.04386},
  year   = {2025}
}

备注

Accepted by TASLP 2025