中文

度量思维链推理的忠实性

人工智能 2023-07-27 v1 计算与语言 机器学习

摘要

大语言模型(LLMs)在回答问题时若先生成逐步的“思维链”(Chain-of-Thought, CoT)推理,表现会更好,但尚不清楚所述推理是否是模型实际推理(即其回答问题的过程)的忠实解释。我们通过考察在对 CoT 进行干预(例如添加错误或改写)时模型预测的变化,研究 CoT 推理可能不忠实的假设。模型在不同任务中对于预测答案时多大程度上以 CoT 为条件表现出巨大差异,有时严重依赖 CoT,有时主要忽略它。CoT 的性能提升似乎并非仅来自 CoT 增加的测试时计算量,也非来自通过 CoT 特定措辞所编码的信息。随着模型变得更大且能力更强,在我们研究的大多数任务上它们产生更不忠实的推理。总体而言,我们的结果表明,若谨慎选择模型规模和任务等情形,CoT 可以是忠实的。

关键词

引用

@article{arxiv.2307.13702,
  title  = {Measuring Faithfulness in Chain-of-Thought Reasoning},
  author = {Tamera Lanham and Anna Chen and Ansh Radhakrishnan and Benoit Steiner and Carson Denison and Danny Hernandez and Dustin Li and Esin Durmus and Evan Hubinger and Jackson Kernion and Kamilė Lukošiūtė and Karina Nguyen and Newton Cheng and Nicholas Joseph and Nicholas Schiefer and Oliver Rausch and Robin Larson and Sam McCandlish and Sandipan Kundu and Saurav Kadavath and Shannon Yang and Thomas Henighan and Timothy Maxwell and Timothy Telleen-Lawton and Tristan Hume and Zac Hatfield-Dodds and Jared Kaplan and Jan Brauner and Samuel R. Bowman and Ethan Perez},
  journal= {arXiv preprint arXiv:2307.13702},
  year   = {2023}
}