ChatGPT 和 DALL-E 2 在决策与空间推理上的初步评估
人工智能
2023-02-21 v1 计算与语言
计算机视觉与模式识别
摘要
我们进行了一项初步研究,选择性地评估了两个最近发布的生成式变换器模型 ChatGPT 和 DALL-E 2 的认知能力(决策和空间推理)。输入提示是按照中立的先验指南构建的,而非出于对抗意图。对输出的事后定性分析表明,DALL-E 2 能够为每个空间推理提示生成至少一个正确的图像,但生成的大多数图像是不正确的(即使模型似乎对提示中提到的对象有清晰的理解)。类似地,在根据经典冯·诺依曼-摩根斯坦效用定理开发的理性公理评估 ChatGPT 时,我们发现,尽管它表现出一定程度的理性决策,但即使在偏好、赌注和决策提示的合理构建下,它的许多决策也至少违反了一个公理。ChatGPT 在此类问题上的输出通常倾向于不可预测:即使它在一些较简单的决策问题上做出了非理性决策(或采用了不正确的推理过程),它也能为更复杂的赌注结构得出正确的结论。我们简要评论了在扩大此类“认知”评估规模或使用封闭式答案集(“真实值”)进行评估时所涉及的细微差别和挑战,因为这些模型在响应提示时本质上是生成性和开放式的。
引用
@article{arxiv.2302.09068,
title = {A Pilot Evaluation of ChatGPT and DALL-E 2 on Decision Making and Spatial Reasoning},
author = {Zhisheng Tang and Mayank Kejriwal},
journal= {arXiv preprint arXiv:2302.09068},
year = {2023}
}