中文

递归反馈链防止冗余提示导致的性能下降

计算与语言 2024-03-04 v2 人工智能

摘要

大型语言模型 (LLM) 在处理复杂推理任务时经常遇到困难,无法构建通向解决方案的逻辑严谨步骤。针对这种行为,用户往往尝试反复提示 LLM,希望能获得更好的响应。本文通过定义一种新设定——反馈链 (Chain-of-Feedback, CoF) 来研究这种重复行为及其影响。该设定以需要多步推理的问题作为输入。在得到响应后,我们重复提示无意义的反馈(例如“再试一次”)以请求额外的尝试。令人惊讶的是,我们的初步结果表明,重复的无意义反馈会逐渐降低响应质量,最终导致与预期结果的更大偏差。为了缓解这些问题,我们提出了一种新方法:递归反馈链 (Recursive Chain-of-Feedback, R-CoF)。遵循计算机科学中的递归逻辑,R-CoF 通过将每个错误的推理步骤分解为更小的独立问题,递归地修正最初错误的响应。我们的初步结果表明,大多数 LLM 无法正确回答的问题,可以使用 R-CoF 得到解答,而无需任何概述逻辑过程的样本数据。

关键词

引用

@article{arxiv.2402.02648,
  title  = {Recursive Chain-of-Feedback Prevents Performance Degradation from Redundant Prompting},
  author = {Jinwoo Ahn and Kyuseung Shin},
  journal= {arXiv preprint arXiv:2402.02648},
  year   = {2024}
}

备注

Still Ongoing Work; 8 Pages; 2 Figures