GPT-4o 通过眼神读心
人机交互
2024-10-31 v2 计算机与社会
摘要
大语言模型(LLMs)能够从文本中再现类似人类的推理,包括关于情绪和心理状态的推理。这种能力是否超越文本扩展到其他模态仍不清楚。人类拥有一种通过他人眼神解读心理状态的复杂能力。我们在此测试了多模态 LLM GPT-4o 是否也具备这种能力。使用广泛使用的心理理论测试的两个版本,即“眼神读心测试”和“多种族眼神读心测试”,我们发现 GPT-4o 在从正立面孔解读心理状态方面优于人类,但在面孔倒置时表现不如人类。虽然我们样本中的人类在白人和非白人面孔之间没有表现出差异,但 GPT-4o 对白人面孔的准确率高于非白人面孔。GPT-4o 的错误并非随机,而是揭示了在多次试验中对心理状态信息进行高度一致但错误的处理,其错误结构依赖于方向,对于倒置面孔,这种错误结构与人类有质的差异,但对于正立面孔则不然。这些发现突显了高级心理状态推理能力和类似人类的面孔处理特征(如倒置效应)如何在 GPT-4o 中共存,同时其信息处理方式与人类相比存在显著差异。
引用
@article{arxiv.2410.22309,
title = {GPT-4o reads the mind in the eyes},
author = {James W. A. Strachan and Oriana Pansardi and Eugenio Scaliti and Marco Celotto and Krati Saxena and Chunzhi Yi and Fabio Manzi and Alessandro Rufo and Guido Manzi and Michael S. A. Graziano and Stefano Panzeri and Cristina Becchio},
journal= {arXiv preprint arXiv:2410.22309},
year = {2024}
}