大语言模型的批判能力
机器学习
2023-10-10 v1
摘要
批判性思维对理性决策与问题解决至关重要。该技能依赖于提供精确且有理据的批判之能力,并是人类智能的标志。在大语言模型(LLM)时代,本研究探讨LLM跨多种任务给出准确批判的能力。我们关注此议题,因为一个有能力的批判模型不仅可作可靠评估者,亦可作模型调优的监督信号源。特别地,若模型能自我批判,便具自主自我改进之潜力。为此,我们引入一个评估LLM批判能力的统一框架。我们构建了名为CriticBench的基准,含3K高质量自然语言查询及对应模型响应,并标注这些响应的正确性。该基准覆盖数学解题、代码补全与问答等任务。我们在所收集数据集上评估多个LLM,分析揭示若干值得注意的洞见:(1)批判对多数LLM generally具挑战性,且该能力常仅于模型足够大时才涌现。(2)尤其,自我批判格外困难,即便顶尖LLM也难获满意表现。(3)模型对其最不确定问题之批判准确率倾向更低。为此,我们引入名为self-check的简单而有效基线,利用自我批判提升各模型任务表现。我们希望本研究作为理解LLM批判能力的初步探索,并旨在启发未来研究,包括更娴熟批判模型之开发及批判跨多样任务之应用。
引用
@article{arxiv.2310.04815,
title = {Critique Ability of Large Language Models},
author = {Liangchen Luo and Zi Lin and Yinxiao Liu and Lei Shu and Yun Zhu and Jingbo Shang and Lei Meng},
journal= {arXiv preprint arXiv:2310.04815},
year = {2023}
}