中文

迈向 LogiGLUE:语言模型逻辑推理能力综述与基准简述

计算与语言 2024-04-02 v3 人工智能

摘要

逻辑推理对人类而言是基础性的,但在人工智能领域仍是一项重大挑战。最初,研究者使用知识表示与推理(KR)系统,这类系统无法扩展且需要不小的手工投入。近来,大语言模型(LLMs)的出现展现出克服形式化知识表示(KR)系统诸多局限的能力。因此,利用 LLM 通过自然语言进行逻辑推理的兴趣日益增长。本工作旨在通过简要回顾该领域最新进展来理解 LLM 在逻辑推理上的能力,重点关注用于逻辑推理的数据集、任务以及采用 LLM 进行推理的方法。为提供透彻分析,我们编撰了一个名为 LogiGLUE 的基准,包含 24 个涵盖演绎、溯因和归纳推理的多样化数据集。以 LogiGLUE 为基础,我们训练了一个指令微调语言模型,即 LogiT5。我们研究了单任务训练、多任务训练以及“思维链”知识蒸馏微调技术,以评估模型在不同逻辑推理类别上的表现。我们还使用 LogiGLUE 评估了多种 LLM,结果表明 LLM 在溯因推理上表现最佳,其次是演绎推理,而在归纳推理上最弱。我们旨在阐明增强 LLM 逻辑推理能力的可能路径与潜力,为该关键领域更先进且精细的发展铺路。

关键词

引用

@article{arxiv.2310.00836,
  title  = {Towards LogiGLUE: A Brief Survey and A Benchmark for Analyzing Logical Reasoning Capabilities of Language Models},
  author = {Man Luo and Shrinidhi Kumbhar and Ming shen and Mihir Parmar and Neeraj Varshney and Pratyay Banerjee and Somak Aditya and Chitta Baral},
  journal= {arXiv preprint arXiv:2310.00836},
  year   = {2024}
}

备注

Work in progress