结构化、灵活且鲁棒:基准测试并改进大语言模型以在分布外推理任务中逼近更类人的表现
计算与语言
2022-05-13 v1 人工智能
机器学习
符号计算
摘要
人类语言为我们思想提供了一扇有力的窗口——我们通过词语讲述故事、给出解释并表达信念与目标。大量证据亦表明语言在构建我们的学习中起着发展性作用。在此我们追问:仅通过学习语言中的统计模式,能在多大程度上捕捉类人思维?我们首先贡献了一个用于比较人类与分布式大语言模型(LLM)的新挑战基准。我们的基准包含两个问题解决领域(规划与解释生成),并被设计成需要对以语言表达的新颖、分布外问题进行泛化。我们发现人类在该基准上远比 LLM 鲁棒。接下来,我们提出一种混合 Parse-and-Solve 模型,用结构化符号推理模块增强分布式 LLM。我们发现该模型对分布外规划问题展现出更鲁棒的适应,证明了混合 AI 模型在更类人推理上的前景。
引用
@article{arxiv.2205.05718,
title = {Structured, flexible, and robust: benchmarking and improving large language models towards more human-like behavior in out-of-distribution reasoning tasks},
author = {Katherine M. Collins and Catherine Wong and Jiahai Feng and Megan Wei and Joshua B. Tenenbaum},
journal= {arXiv preprint arXiv:2205.05718},
year = {2022}
}
备注
Originally accepted to the 2022 Cognitive Science (CogSci) conference