中文

评估大语言模型在指令遵循评判上的能力

计算与语言 2024-04-17 v2 机器学习

摘要

随着大语言模型(LLM)研究的持续加速,基于 LLM 的评估作为一种可扩展且经济高效的替代人类评估的方法,已涌现用于比较不断增加的模型列表。本文研究了这些“LLM 评估器”的有效性,特别是在使用它们评估指令遵循方面的效用,该指标衡量生成文本与所给指令的贴合程度。我们引入了一个具有挑战性的元评估基准 LLMBar,旨在测试 LLM 评估器辨别指令遵循输出的能力。作者人工整理了 419 对输出,其中一对遵循指令而另一对偏离,但可能具有误导 LLM 评估器的欺骗性特质,例如更具吸引力的语气。与现有元评估相反,我们发现不同的评估器(即 LLM 与提示的组合)在 LLMBar 上表现出不同的性能,甚至得分最高的也存在 substantial 改进空间。我们还提出了一套新颖的提示策略,进一步缩小了 LLM 与人类评估器之间的差距。借助 LLMBar,我们希望对 LLM 评估器提供更多见解,并促进未来开发更好指令遵循模型的研究。

关键词

引用

@article{arxiv.2310.07641,
  title  = {Evaluating Large Language Models at Evaluating Instruction Following},
  author = {Zhiyuan Zeng and Jiatong Yu and Tianyu Gao and Yu Meng and Tanya Goyal and Danqi Chen},
  journal= {arXiv preprint arXiv:2310.07641},
  year   = {2024}
}

备注

ICLR 2024