大语言模型上面向开放域多跳推理的自提示思维链
计算与语言
2023-10-24 v2 人工智能
摘要
在开放域问答(ODQA)中,多数现有问题仅需基于常识的单跳推理。为拓展该任务,我们正式引入开放域多跳推理(ODMR),即在开放域设定下通过显式推理步骤回答多跳问题。近来,大语言模型(LLMs)在无外部语料辅助 ODQA 方面展现出重要效用。此外,思维链(CoT)提示以手动或自动范式进一步大幅增强了 LLMs 的推理能力。然而,现有自动化方法缺乏质量保证,而手动方法受限于可扩展性差与多样性不足,制约了 LLMs 的能力。本文提出自提示思维链(SP-CoT),一种由 LLMs 生成、为 LLMs 服务的自动化框架,可大规模产出高质量 CoTs。SP-CoT 引入了高质量 ODMR 数据集的自动化生成流程、用于上下文 CoT 选择的自适应采样器,以及通过上下文学习实现的自提示推理。在四个多跳问答基准上的大量实验表明,我们所提 SP-CoT 不仅在大规模(175B)LLMs 上显著超越先前 SOTA 方法,还将小规模(13B)LLMs 的零样本性能提升近一倍。进一步分析揭示,SP-CoT 能通过召回 MuSiQue-Ans 数据集上约 50% 的中间答案,激发出直接且简洁的中间推理步骤。
引用
@article{arxiv.2310.13552,
title = {Self-prompted Chain-of-Thought on Large Language Models for Open-domain Multi-hop Reasoning},
author = {Jinyuan Wang and Junlong Li and Hai Zhao},
journal= {arXiv preprint arXiv:2310.13552},
year = {2023}
}
备注
Accepted by Findings of EMNLP2023