中文

指导大型语言模型识别并忽略无关条件

计算与语言 2024-03-20 v1

摘要

数学应用题(MWP)求解需要根据给定的问题描述生成推理路径,而这些描述通常包含无关条件。现有的思维链提示方法激发了大型语言模型(LLM)的多步推理能力以求解 MWP。然而,它们受到无关条件的严重干扰,导致准确率较低。在本文中,我们提出了一种名为 I3^3C 的新方法,指导 LLM 识别并忽略无关条件。它首先识别出一组与问题语义相关性较弱的无关条件候选。然后提示 LLM 验证这些无关条件。最后,它利用对相关和无关条件的验证来指导 LLM,以避免混淆并改善推理路径。此外,我们提出选择(问题,推理路径)对作为示例,以通过少样本推理增强 I3^3C。我们开发了 I3^3C-Select,基于语义相关性度量选择最容易混淆的问题。我们在八个 MWP 数据集上进行了大量实验。I3^3C 可以与任何 CoT 提示方法相结合,以提高求解 MWP 的性能。值得注意的是,借助 GPT-3.5-Turbo 和 I3^3C-Select,我们在 GSM-IC2-1K 和 GSM-ICM-1K 上分别达到了 96.0 和 94.1 的准确率,显著超越了当前最先进的少样本提示方法 Complex-CoT +11.7 和 +11.1。我们的实现已在 https://wzy6642.github.io/I3C.github.io/ 公开发布。

关键词

引用

@article{arxiv.2403.12744,
  title  = {Instructing Large Language Models to Identify and Ignore Irrelevant Conditions},
  author = {Zhenyu Wu and Chao Shen and Meng Jiang},
  journal= {arXiv preprint arXiv:2403.12744},
  year   = {2024}
}

备注

NAACL 2024 - Camera Ready