中文

RCOT:通过逆向思维链检测与纠正推理中的事实不一致性

计算与语言 2023-10-03 v2

摘要

大型语言模型(LLMs)通过引入逐步的思维链(Chain-of-Thought, CoT)提示,在算术推理任务上取得了令人瞩目的性能。然而,LLMs在推理过程中保持事实一致性方面面临挑战,表现出对给定问题的条件忽略、问题误解和条件幻觉倾向。现有方法使用粗粒度反馈(例如答案是否正确)来提升事实一致性。在这项工作中,我们提出RCoT(Reversing Chain-of-Thought,逆向思维链),一种通过自动检测并纠正LLMs生成解中的事实不一致性来改进LLMs推理能力的新方法。为检测事实不一致性,RCoT首先让LLMs基于生成的解重构问题。随后,原始问题与重构问题之间的细粒度比对揭示了原始解中的事实不一致性。为纠正解,RCoT将检测到的事实不一致性转化为细粒度反馈,以引导LLMs修订解。实验结果表明,RCoT在七个算术数据集上优于标准CoT、Self-Consistency和Self-Refine。此外,我们发现人工编写的细粒度反馈可大幅提升LLMs的推理能力(例如ChatGPT在GSM8K上达到94.6%准确率),这鼓励社区进一步探索细粒度反馈生成方法。

关键词

引用

@article{arxiv.2305.11499,
  title  = {RCOT: Detecting and Rectifying Factual Inconsistency in Reasoning by Reversing Chain-of-Thought},
  author = {Tianci Xue and Ziqi Wang and Zhenhailong Wang and Chi Han and Pengfei Yu and Heng Ji},
  journal= {arXiv preprint arXiv:2305.11499},
  year   = {2023}
}

备注

24 pages, 21 figures