GPT-4与人类的文本理解能力对比
计算与语言
2025-01-22 v4
摘要
我们首先使用一项成熟的标准化篇章理解测试,考察领先的AI系统GPT-4对文本的理解是否与人类相当。在该测试中,鉴于人类表现已处于极高水平,GPT-4的表现略优于人类,但差异不具有统计显著性。GPT-4和人类都能对文本中未明确陈述的信息做出正确推断,这是理解能力的一项关键检验。接下来,我们使用难度更高的篇章,以确定这是否能拉开GPT-4与人类之间的差距。在这些作为学生阅读理解入学测试而设计的更难文本上,GPT-4的表现远优于这些文本所针对的高中生和大学生。对GPT-4在其中一项入学测试材料上表现的深入探索,揭示了公认的真正理解的标志,即泛化与推理。
引用
@article{arxiv.2403.17196,
title = {Text Understanding in GPT-4 vs Humans},
author = {Thomas R. Shultz and Jamie M. Wise and Ardavan Salehi Nobandegani},
journal= {arXiv preprint arXiv:2403.17196},
year = {2025}
}
备注
22 pages, 2 figures, 5 tables