中文

语言模型能否在含噪思维链提示下进行鲁棒推理?

计算与语言 2024-11-01 v1 机器学习

摘要

本文研究了大语言模型(LLM)中一个尚未被充分探索的挑战:带有噪声理由的思维链提示,即在用于上下文学习的示例中包含不相关或不准确的推理思路。我们构建了 NoRa 数据集,专门用于评估在存在噪声理由情况下的推理鲁棒性。我们在 NoRa 数据集上的发现揭示了当前 LLM 普遍存在对这种噪声的脆弱性,而现有的鲁棒方法(如自我修正和自我一致性)效果有限。值得注意的是,与使用干净理由的提示相比,基础 LLM 在包含不相关思路时准确率下降了 1.4%-19.8%,而在包含不准确思路时下降更为剧烈,达到 2.2%-40.4%。应对这一挑战需要实践中可获取的外部监督。在此,我们提出了带噪思维链的对比去噪(CD-CoT)方法。它通过将噪声理由与仅一个干净理由进行对比,来增强 LLM 的去噪推理能力,这可以作为去噪目的提示的最低要求。该方法遵循探索与利用的原则:(1)在输入空间中对理由进行改写和选择以实现显式去噪,以及(2)在输出空间中探索多样化的推理路径并对答案进行投票。实验证明,CD-CoT 在准确率上相比基础模型平均提高了 17.8%,并显示出比基线方法显著更强的去噪能力。源代码公开于:https://github.com/tmlr-group/NoisyRationales。

关键词

引用

@article{arxiv.2410.23856,
  title  = {Can Language Models Perform Robust Reasoning in Chain-of-thought Prompting with Noisy Rationales?},
  author = {Zhanke Zhou and Rong Tao and Jianing Zhu and Yiwen Luo and Zengmao Wang and Bo Han},
  journal= {arXiv preprint arXiv:2410.23856},
  year   = {2024}
}

备注

Accepted by NeurIPS 2024