中文

大语言模型同样是优秀的原型化常识推理器

计算与语言 2023-09-26 v1 人工智能

摘要

常识推理是大语言模型的一项关键能力,然而在需要该能力的特定任务中它仍带来持续挑战。传统的微调方法可能耗费大量资源,并可能损害模型的泛化能力。此外,诸如 GPT-3.5 和 Claude 等最先进的语言模型主要通过 API 调用访问,这使得微调模型颇具挑战。为应对这些挑战,我们从大模型在定制任务上的输出中汲取灵感,并从任务相关性、支持性证据生成(如思维链和知识)、多样化路径解码以辅助模型等多个视角半自动地开发了一组新颖提示。在 ProtoQA 数据集上的实验结果表明,通过更好设计的提示,我们能在 ProtoQA 排行榜上达到新的最先进水平 (SOTA),与先前 SOTA 模型相比,Max Answer@1 分数提升 8%,Max Incorrect@1 分数提升 4%(首次突破 50%),并在 StrategyQA 和 CommonsenseQA2.0 上取得改进(分别为 3% 和 1%)。此外,借助生成的思维链和知识,我们在超越先前 SOTA 模型的同时提升了模型的可解释性。我们希望我们的工作能为 NLP 社区提供见解,以开发更好的提示并探索大语言模型在更复杂推理任务中的潜力。

关键词

引用

@article{arxiv.2309.13165,
  title  = {Large Language Models Are Also Good Prototypical Commonsense Reasoners},
  author = {Chenin Li and Qianglong Chen and Yin Zhang and Yifei Zhang and Hongxiang Yao},
  journal= {arXiv preprint arXiv:2309.13165},
  year   = {2023}
}