中文

利用大语言模型的归纳偏置进行抽象文本推理

计算与语言 2021-10-07 v1 人工智能

摘要

大型自然语言模型(如 GPT-3 或 T5)在一系列通用 NLP 任务中展现出令人印象深刻的能力。本文表明,此类模型中嵌入的知识提供了一种有用的归纳偏置,不仅适用于传统 NLP 任务,也适用于训练符号推理引擎这一非传统任务。我们观察到这些引擎学习迅速,并以反映人类直觉的自然方式泛化。例如,训练这样的系统建模积木堆叠,可能会自然泛化到堆叠其他类型的物体,因为现实世界的结构已通过描述它的语言被部分捕捉。我们研究了若干抽象文本推理任务,如物体操控与导航,并展示了对新颖场景及其组成符号的多类泛化。我们还展示了组合学习(compositional learning)的惊人效用:致力于掌握复杂任务的学习器,通过先在相关简单任务上训练、而非直接跳入复杂任务,从而获得优势。

关键词

引用

@article{arxiv.2110.02370,
  title  = {Leveraging the Inductive Bias of Large Language Models for Abstract Textual Reasoning},
  author = {Christopher Michael Rytting and David Wingate},
  journal= {arXiv preprint arXiv:2110.02370},
  year   = {2021}
}