中文

LLM-ARC: 用自动推理评论器增强大语言模型

计算与语言 2024-07-22 v2 人工智能 计算机科学中的逻辑

摘要

我们引入了LLM-ARC,一个神经符号框架,旨在通过将大语言模型(LLM)与自动推理评论器(ARC)相结合来增强其逻辑推理能力。LLM-ARC采用Actor-Critic方法,其中LLM Actor生成声明式逻辑程序以及用于语义正确性测试的代码,而自动推理评论器则评估代码、运行测试并提供关于测试失败的反馈以进行迭代改进。使用回答集编程(ASP)实现,LLM-ARC在测试复杂逻辑推理能力的FOLIO基准上达到了88.32%的最新准确率。我们的实验表明,与仅使用LLM的基线相比,性能有显著提升,凸显了逻辑测试生成和迭代自我改进的重要性。我们使用完全自动化的自监督训练循环获得了最佳结果,其中Actor在包含Critic反馈的端到端对话轨迹上进行训练。我们讨论了潜在的改进方向并提供了详细的错误分析,展示了LLM-ARC在复杂自然语言推理任务中的鲁棒性和有效性。

关键词

引用

@article{arxiv.2406.17663,
  title  = {LLM-ARC: Enhancing LLMs with an Automated Reasoning Critic},
  author = {Aditya Kalyanpur and Kailash Karthik Saravanakumar and Victor Barres and Jennifer Chu-Carroll and David Melville and David Ferrucci},
  journal= {arXiv preprint arXiv:2406.17663},
  year   = {2024}
}