基于迷宫测试评估大型语言模型中的意识相关行为
计算与语言
2025-08-26 v1 人工智能
摘要
我们利用迷宫测试(Maze Test)探讨大型语言模型(LLM)中类似意识的行为。该测试从第一人称视角挑战模型导航迷宫,同时探测空间意识、视角迁移、目标导向行为以及时间序列等关键意识关联特征。经过将意识理论综合为13项核心特征后,对12个领先LLM在零样本、零样本和少样本学习场景中进行评估。结果显示,具备推理能力的LLM在各项指标上 consistently 优于标准版本,其中Gemini 2.0 Pro实现了52.9%的完整路径准确率,DeepSeek-R1达到了80.5%的部分路径准确率。这些指标之间的差距表明LLM在解决方案中难以维持连贯的自我模型——这是意识的基本特征之一。尽管LLM通过推理机制在意识相关行为方面取得了进展,但仍缺乏意识所特有的集成性、持久的自我意识。
引用
@article{arxiv.2508.16705,
title = {Assessing Consciousness-Related Behaviors in Large Language Models Using the Maze Test},
author = {Rui A. Pimenta and Tim Schlippe and Kristina Schaaff},
journal= {arXiv preprint arXiv:2508.16705},
year = {2025}
}