CriticBench:评估大语言模型的批判 - 修正推理能力
计算与语言
2024-06-04 v4 人工智能
机器学习
摘要
大语言模型(LLM)批判和修正其推理的能力对于其在评估、提供反馈和自我改进方面的应用至关重要。本文介绍了 CriticBench,这是一个旨在评估 LLM 在各种任务中批判和修正其推理能力的综合基准。CriticBench 涵盖五个推理领域:数学、常识、符号、编码和算法。它汇编了 15 个数据集,并纳入了三个 LLM 家族的响应。利用 CriticBench,我们评估并剖析了 17 个 LLM 在生成、批判和修正推理(即 GQC 推理)方面的表现。我们的发现揭示:(1) GQC 能力之间存在线性关系,专注于批判的训练显著提升了性能;(2) 修正效果存在任务依赖性差异,面向逻辑的任务更易于修正;(3) GQC 知识不一致性随模型规模增大而减小;(4) 存在一种有趣的模型间批判动态,即更强的模型更擅长批判较弱的模型,而较弱的模型在自我批判方面却出人意料地超越更强的模型。我们希望这些关于 LLM 细微差别批判 - 修正推理的见解能促进 LLM 批判和自我改进方面的进一步研究。
引用
@article{arxiv.2402.14809,
title = {CriticBench: Benchmarking LLMs for Critique-Correct Reasoning},
author = {Zicheng Lin and Zhibin Gou and Tian Liang and Ruilin Luo and Haowei Liu and Yujiu Yang},
journal= {arXiv preprint arXiv:2402.14809},
year = {2024}
}
备注
ACL 2024 Findings