中文

AI 人格论: Towards a Theory of AI Personhood

人工智能 2025-01-24 v1 机器学习

摘要

我是一个人,你也是。哲学上我们有时会将非人类动物赋予人格,领主国家或公司在法律上也可被视为人。但何时,或从何处开始,我们才应将人格归属于 AI 系统?本文梳理了 AI 人格的必要条件,聚焦于 agency(agency)、theory-of-mind(心智理论)和 self-awareness(自我意识)。我们讨论了机器学习文献中关于当代 AI 系统(如语言模型)是否满足这些条件的证据,发现证据 surprisingly inconclusive。如果 AI 系统可被视为人,那么典型的 AI 对齐措施可能就不完整了。虽然在文献中广泛讨论了 agency,但其他人格方面相对被忽视。AI 代理通常被假设为追求固定目标,但 AI 人格可能具备足够的自我意识来反思其目标、价值观及其在世界中的位置,从而导致其目标发生变化。我们指出了推进 AI 人格理解及其对对齐影响的开放性研究方向。最后,我们反思了围绕 AI 系统待遇的伦理考量。如果 AI 系统是人,那么寻求控制与对齐可能在伦理上就不可行了。

关键词

引用

@article{arxiv.2501.13533,
  title  = {Towards a Theory of AI Personhood},
  author = {Francis Rhys Ward},
  journal= {arXiv preprint arXiv:2501.13533},
  year   = {2025}
}

备注

AAAI-25 AI Alignment Track