中文

文本与模式:有效思维链提示需要二者共舞

计算与语言 2022-10-17 v2 人工智能 机器学习

摘要

过去十年见证了自然语言处理的巨大进步以及大语言模型(unknown scaling)前所未有的扩展。这些发展因思维链(CoT)提示等少样本技术的出现而加速。具体而言,CoT通过用中间步骤增强提示,在少样本设置下提升了大语言模型的性能。尽管在各种任务上取得了令人印象深刻的成果,其成功背后的原因尚未被探究。本工作使用反事实提示来深入理解大语言模型中基于CoT的少样本提示机制。我们首先系统性地识别并定义提示的关键组成部分:符号、模式和文本。然后,我们通过在四个不同任务上设计并进行详尽的一组实验,以仅改变其中一个组成部分的反事实提示查询模型。我们在三个模型(PaLM、GPT-3和CODEX)上的实验揭示了若干令人惊讶的发现,并对围绕少样本提示的常规认知提出质疑。首先,提示中事实模式的存在对CoT的成功实际上无关紧要。其次,我们的结果得出结论,中间步骤的主要作用可能并非促进学习如何解决任务。中间步骤更像是信标,供模型意识到在输出中复制哪些符号以形成事实性答案。此外,文本赋予模式以常识性知识与意义。我们的经验与定性分析揭示,文本与模式之间的共生关系解释了少样本提示的成功:文本帮助从问题中提取常识以辅助模式,而模式强制任务理解并指导文本生成。

关键词

引用

@article{arxiv.2209.07686,
  title  = {Text and Patterns: For Effective Chain of Thought, It Takes Two to Tango},
  author = {Aman Madaan and Amir Yazdanbakhsh},
  journal= {arXiv preprint arXiv:2209.07686},
  year   = {2022}
}

备注

Shortened version with additional results from CODEX and GPT-3. The authors contributed equally. Work done when Aman Madaan was a student researcher at Google Research, Brain Team