中文

少样本提示中文本推理解释的不可靠性

计算与语言 2022-10-14 v2

摘要

以类似 GPT-3 的解释提示大型语言模型(LLM)是否能改善上下文学习?我们在两个涉及文本推理的 NLP 任务(即问答与自然语言推理)上研究此问题。我们使用包含多种风格解释的提示,测试四个 LLM 在三个文本推理数据集上的表现。对于这些任务,我们发现于 OPT、GPT-3(davinci)和 InstructGPT(text-davinci-001)的提示中包含解释仅带来相对于标准少样本学习微小至中等的准确率提升。然而,text-davinci-002 能够获益更多。我们进一步表明,LLM 生成的解释可能既不等价于模型预测,也不基于输入的事实,即便在带有抽取式解释的简单任务上亦然。但这些有缺陷的解释仍可作为事后验证 LLM 预测的有用手段。通过我们三种设定下的分析,我们发现被人类判定为良好(与输入及预测逻辑一致)的解释更可能与准确预测共存。遵循这些观察,我们利用自动提取的、评估解释可靠性的分数训练校准器,从而得以在所有数据集上事后提升性能。

关键词

引用

@article{arxiv.2205.03401,
  title  = {The Unreliability of Explanations in Few-shot Prompting for Textual Reasoning},
  author = {Xi Ye and Greg Durrett},
  journal= {arXiv preprint arXiv:2205.03401},
  year   = {2022}
}

备注

NeurIPS 2022