人类与大型语言模型中的归纳推理
计算与语言
2023-08-07 v3 人工智能
摘要
大型语言模型近期的出色表现令许多人好奇它们在多大程度上可作为通用智能的模型或与人类认知相似。我们通过将 GPT-3.5 和 GPT-4 应用于一个被称为属性归纳的人类归纳推理经典问题来探讨这一问题。在两项实验中,我们引发了人类在跨越多个领域的系列属性归纳任务上的判断。尽管 GPT-3.5 难以捕捉人类行为的许多方面,GPT-4 则要成功得多:在大多数情况下,其表现定性地匹配人类,且唯一值得注意的例外是它未能捕捉前提非单调性现象。我们的工作表明属性归纳能够实现人类与机器智能之间有趣的比较,并提供了两个可用作此类未来工作基准的大型数据集。
引用
@article{arxiv.2306.06548,
title = {Inductive reasoning in humans and large language models},
author = {Simon J. Han and Keith Ransom and Andrew Perfors and Charles Kemp},
journal= {arXiv preprint arXiv:2306.06548},
year = {2023}
}
备注
61 pages, 5 figures