多模态 AI 系统在视角采择上的失败
人工智能
2024-09-24 v1
摘要
本研究扩展了先前关于多模态 AI 系统中空间表示的研究。尽管当前模型展示了对图像中空间信息的丰富理解,但这些信息根植于命题表示,这与人类和动物空间认知中所采用的模拟表示不同。为了进一步探索这些局限性,我们应用认知科学和发展科学的技术评估了 GPT-4o 的视角采择能力。我们的分析能够比较人类大脑与多模态 AI 的认知发展,为未来的研究和模型开发提供指导。
引用
@article{arxiv.2409.13929,
title = {Failures in Perspective-taking of Multimodal AI Systems},
author = {Bridget Leonard and Kristin Woodard and Scott O. Murray},
journal= {arXiv preprint arXiv:2409.13929},
year = {2024}
}