中文

何时需要ChatGPT的思维链提示?

广义相对论与量子宇宙学 2023-07-24 v2

摘要

思维链(CoT)提示可有效引发大语言模型(LLMs)的复杂多步推理。例如,只需在MultiArith数据集的每个输入查询中添加CoT指令“让我们一步步思考”,GPT-3的准确率便能从17.7%提升至78.7%。然而,尚不清楚CoT在近期指令微调(IFT)LLM(如ChatGPT)上是否仍然有效。令人惊讶的是,在ChatGPT上,CoT对某些任务(如算术推理)不再有效,而在其他推理任务上仍保持有效。此外,在前一类任务上,ChatGPT通常取得最佳性能,且即使未被指示也会生成CoT。因此,ChatGPT很可能已在带CoT的此类任务上训练过并记住了该指令,从而在应用于相同查询时即使无CoT也会隐式遵循该指令。我们的分析反映了IFT引入的指令过拟合/偏置的潜在风险,这在LLM训练中愈发常见。此外,它表明预训练方案可能泄露,例如可验证某数据集与指令是否用于训练ChatGPT。我们的实验报告了ChatGPT在多种推理任务上的新基线结果,并对LLM画像、指令记忆与预训练数据集泄露提供了新见解。

关键词

引用

@article{arxiv.2304.03263,
  title  = {Regular hairy black holes through Minkowski deformation},
  author = {Jorge Ovalle and Roberto Casadio and Andrea Giusti},
  journal= {arXiv preprint arXiv:2304.03263},
  year   = {2023}
}

备注

8 pages, 3 figures, final version to appear in Phys.Lett.B