人类价值观的计算框架
人工智能
2026-02-09 v2 计算机与社会
多智能体系统
摘要
在心理学、哲学和社会科学中探讨人类价值观本质的各类研究里,存在一个明确共识:价值观引导行为。近来,人们认识到价值观为构建合乎伦理的 AI 提供了手段。事实上,Stuart Russell 提出将 AI 的焦点从单纯的“智能”转向“可证明与人类价值观对齐”的智能。这一挑战——价值观对齐问题——连同其他问题(包括 AI 学习人类价值观、将个体价值观聚合为群体价值观,以及设计用于对价值观进行推理的计算机制)已激发持续的研究努力。尽管如此,迄今尚未提出任何正式的、计算性的价值观定义。我们通过一个植根于社会科学的形式化概念框架来解决此问题,该框架为如何使人类价值观支撑合乎伦理的 AI 设计提供了系统性、整合性与跨学科研究的基础。
引用
@article{arxiv.2305.02748,
title = {A computational framework for human values},
author = {Nardine Osman and Mark d'Inverno},
journal= {arXiv preprint arXiv:2305.02748},
year = {2026}
}