中文

CriticEval:将大型语言模型作为评论者的评估

计算与语言 2024-10-22 v5 人工智能

摘要

评论能力,即大型语言模型(LLM)识别和纠正回复中缺陷的能力,对于其在自我改进和可扩展监督中的应用至关重要。尽管已有大量研究提出评估 LLM 的评论能力,但其全面性和可靠性仍然有限。为克服这一问题,我们引入了 CriticEval,一个旨在全面、可靠地评估 LLM 评论能力的新颖基准。具体而言,为确保全面性,CriticEval 从四个维度、九种多样的任务场景评估评论能力。它评估标量值评论和文本评论,针对不同质量的回复。为确保可靠性,大量评论被标注作为参考,使 GPT-4 能够可靠地评估文本评论。对开源和闭源 LLM 的广泛评估首先验证了 CriticEval 中评估的可靠性。随后,实验结果证明了开源 LLM 的巨大潜力、评论数据集的有效性,以及评论能力与若干关键因素(包括任务类型、回复质量和评论维度)之间的若干有趣关系。

关键词

引用

@article{arxiv.2402.13764,
  title  = {CriticEval: Evaluating Large Language Model as Critic},
  author = {Tian Lan and Wenwei Zhang and Chen Xu and Heyan Huang and Dahua Lin and Kai Chen and Xian-ling Mao},
  journal= {arXiv preprint arXiv:2402.13764},
  year   = {2024}
}