认识自我?论 AI 自我识别的无能力与影响
人工智能
2025-10-07 v1 计算与语言
计算机与社会
机器学习
摘要
自我识别是 AI 系统的一项关键元认知能力,不仅与心理分析相关,还与安全性(尤其是在评估场景中)密切相关。受关于模型是否具备自我识别的矛盾解释的启发(Panickssery 等,2024;Davidson 等,2024),我们引入了一个易于应用和更新的系统性评估框架。具体而言,我们通过两项任务测量了 10 个当代大型语言模型(LLM)识别自身生成文本与其他模型生成文本的能力:二元自我识别和精确模型预测。与先前的声明不同,我们的结果揭示了自我识别的一致性失败。10 个模型中仅有 4 个预测自身为生成者,且其表现极少高于随机概率。此外,模型表现出偏向于预测 GPT 和 Claude 家族的强烈倾向。我们还首次评估了模型对自身及他者存在的认知,以及它们在自我识别中做出选择背后的推理。我们发现,模型表现出对自身存在及其他模型的某种认知,但其推理揭示了一种分层偏见。它们似乎假设 GPT、Claude 以及偶尔的 Gemini 是顶级模型,通常将高质量文本与它们关联起来。我们最后讨论了我们的发现对 AI 安全的影响以及开发适当 AI 自我意识的未来方向。
引用
@article{arxiv.2510.03399,
title = {Know Thyself? On the Incapability and Implications of AI Self-Recognition},
author = {Xiaoyan Bai and Aryan Shrivastava and Ari Holtzman and Chenhao Tan},
journal= {arXiv preprint arXiv:2510.03399},
year = {2025}
}
备注
Our code is available, see https://github.com/ChicagoHAI/self-recognition