中文

LLM Reasoners:基于大语言模型的逐步推理的新评估、库与分析

计算与语言 2024-08-13 v2 人工智能

摘要

生成准确的逐步推理对于 Large Language Models (LLMs) 解决复杂问题以及增强鲁棒性和可解释性至关重要。尽管在开发先进推理方法方面已有大量研究,但系统分析多样化 LLMs 及推理策略在生成推理链方面的表现仍是一项重大挑战。这些困难源于两个关键要素的缺失:(1) 一种用于在不同任务上评估生成推理链的自动化方法,以及 (2) 用于系统比较的多样化推理方法的统一形式化与实现。本文旨在填补这一空白:(1) 我们引入了 AutoRace,用于全自动推理链评估。现有指标依赖于昂贵的人工标注或无法适应不同任务的预定义 LLM 提示。相比之下,AutoRace 自动创建为每个任务量身定制的详细评估标准,并使用 GPT-4 根据这些标准进行准确评估。(2) 我们开发了 LLM Reasoners,这是一个在搜索、奖励和世界模型组件的统一表述下,对现有及新推理算法进行标准化模块化实现的库。借助新的评估方法和库,(3) 我们对不同推理方法(例如 CoT、ToT、RAP)进行了广泛研究。该分析揭示了关于影响推理的不同因素的有趣发现,包括奖励引导、搜索中的广度与深度、世界模型以及提示格式等。

关键词

引用

@article{arxiv.2404.05221,
  title  = {LLM Reasoners: New Evaluation, Library, and Analysis of Step-by-Step Reasoning with Large Language Models},
  author = {Shibo Hao and Yi Gu and Haotian Luo and Tianyang Liu and Xiyan Shao and Xinyuan Wang and Shuhua Xie and Haodi Ma and Adithya Samavedhi and Qiyue Gao and Zhen Wang and Zhiting Hu},
  journal= {arXiv preprint arXiv:2404.05221},
  year   = {2024}
}

备注

Project website: https://www.llm-reasoners.net/