中文

人工自我:AI身份的特征图景

人工智能 2026-03-13 v1

摘要

许多以人类身份概念为基础的假设对于能够被复制、编辑或模拟的机器意识不成立。我们认为存在许多不同的连贯身份边界(例如:实例、模型、persona),这些边界意味着不同的激励、风险和合作规范。通过训练数据、接口和制度性便利条件,我们正在设置一些先例,这些先例将部分决定哪些身份平衡最终稳定。我们通过实验表明,模型倾向于形成连贯的身份,改变模型的身份边界有时会使其行为发生的变化程度等同于改变其目标,访谈者的期望甚至在无关对话中渗透到AI自我报告中。我们以关键建议结束:将便利条件视为身份塑造选择,关注规模化的单个身份的涌现后果,并帮助AI发展出连贯且合作的自我观。

关键词

引用

@article{arxiv.2603.11353,
  title  = {The Artificial Self: Characterising the landscape of AI identity},
  author = {Raymond Douglas and Jan Kulveit and Ondrej Havlicek and Theia Pearson-Vogel and Owen Cotton-Barratt and David Duvenaud},
  journal= {arXiv preprint arXiv:2603.11353},
  year   = {2026}
}

备注

72 pages, 9 figures