中文

利用选择性过滤缓解误导性思维链推理

计算与语言 2024-03-29 v1 人工智能

摘要

大语言模型通过利用思维链 (CoT) 推理技术,经由逐步推理链解决复杂问题,展现出了卓越的能力。尽管取得了成功,但此类推理的有效性本质上取决于 CoT 的质量。然而,由于不可分解问题的存在以及错误推理链的潜在可能,无法保证完美的 CoT 推理,在小规模语言模型中尤为如此。为应对这一挑战,我们提出了一种名为选择性过滤推理器 (SelF-Reasoner) 的新方法,用于评估问题与候选推理链之间的蕴含关系。然后,当推理链表现出置信度时,我们继续进行 CoT 推理;否则,我们选择直接预测答案。SelF-Reasoner 在 ScienceQA、ECQA 和 LastLetter 任务上持续改进了微调的 T5 基线。代码可在 https://github.com/LibroWu/SelF-Reasoner 获取。

关键词

引用

@article{arxiv.2403.19167,
  title  = {Mitigating Misleading Chain-of-Thought Reasoning with Selective Filtering},
  author = {Yexin Wu and Zhuosheng Zhang and Hai Zhao},
  journal= {arXiv preprint arXiv:2403.19167},
  year   = {2024}
}