中文

问题分析引导提升 LLM 在推理任务中的表现

计算与语言 2024-08-27 v2

摘要

尽管 LLM 有潜力改变多个领域,但它们在推理任务中仍不如人类表现。现有方法诱导模型产生逐步计算,但本研究探索了这样一个问题:是否通过使 LLM 对问题进行分析来提高其表现?我们提出了一种新颖的提示策略,称为问题分析提示(Question Analysis Prompting, QAP),在该策略中,模型被提示在解答前以 nn 单词解释问题。nn 的值影响模型生成的响应长度。我们在 GPT 3.5 Turbo 和 GPT 4 Turbo 上对 QAP 进行评估,分别用于算术数据集 GSM8K、AQuA 和 SAT 以及常识数据集 StrategyQA。QAP 与其他最先进的提示方法进行了比较,包括链式思维(Chain-of-Thought, CoT)、计划求解提示(Plan and Solve Prompting, PS+)和深呼吸提示(Take A Deep Breath, TADB)。在 AQuA 和 SAT 数据集上,QAP 在 GPT3.5 和 GPT4 上均优于所有最先进的提示方法。QAP 在 75% 的测试中始终排名位于前 2 位。QAP 表现的关键因素之一可归因于响应长度,当回答难题时,详细的响应有益,但会对简单问题产生负面影响。

关键词

引用

@article{arxiv.2407.03624,
  title  = {Question-Analysis Prompting Improves LLM Performance in Reasoning Tasks},
  author = {Dharunish Yugeswardeenoo and Kevin Zhu and Sean O'Brien},
  journal= {arXiv preprint arXiv:2407.03624},
  year   = {2024}
}

备注

Accepted in Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics: Student Research Workshop (ACL-SRW 2024) 11 pages, 8 figures