中文

机器心智理论与人类价值的结构

人工智能 2025-05-28 v1

摘要

价值学习是安全且合乎伦理的 AI 的一个关键方面。目前主要通过从行为中推断人类价值的方法来追求这一目标。然而,人类所关心的远比我们能够通过行动展示的要多。因此,AI 必须从有限的样本中预测我们看似复杂的其余价值。我将此称为价值泛化问题。在本文中,我论证人类价值具有生成的理性结构,并且这使我们能够解决价值泛化问题。具体而言,我们可以使用贝叶斯心智理论模型不仅从行为中,而且从其他价值中推断人类价值。这一点由于广泛使用简单的效用函数来表示人类价值而被掩盖。我得出结论,开发生成的价值到价值推断是实现可扩展机器心智理论的关键组成部分。

关键词

引用

@article{arxiv.2505.20342,
  title  = {Machine Theory of Mind and the Structure of Human Values},
  author = {Paul de Font-Reaulx},
  journal= {arXiv preprint arXiv:2505.20342},
  year   = {2025}
}

备注

This paper was originally submitted and accepted to the 2023 NeurIPS MP2 Workshop