动态规范性:价值对齐的必要与充分条件
人工智能
2024-06-19 v2 计算机与社会
摘要
道德与规范性议题贯穿哲学领域,甚至延伸至所有人文学科。近年来,这一主题意外地流入了人工智能(AI)研究这一不寻常的领域。道德与AI的核心问题是“对齐”(alignment),即如何以人类可接受的方式表达人类目标与价值,使之可被人工系统遵循而不引发不必要的对抗性后果。更明确地说,在当前AI开发范式下,我们可将对齐理解为将人类价值教授给非人类化实体,而这些实体通过不透明的梯度化学习技术进行训练。本文将对齐视为需要扎实哲学基础和实际实现的技术-哲学问题,旨在将规范理论引入AI系统开发。为此,我们提出两组必要条件与充分条件,认为其应被纳入任何对齐过程。必要条件作为形而上学和元伦理学的根源,涉及对齐的可允许性;充分条件则在学习范式下建立AI系统对齐的蓝图。建立这些基础后,我们使用最新技术与方法实现了该方法,构建名为“动态规范性”(Dynamic Normativity)的框架。其核心论点是:任何在学习范式下且无法满足其必要条件与充分条件的对齐过程,都将失败于产生对齐的系统。
引用
@article{arxiv.2406.11039,
title = {Dynamic Normativity: Necessary and Sufficient Conditions for Value Alignment},
author = {Nicholas Kluge Corrêa},
journal= {arXiv preprint arXiv:2406.11039},
year = {2024}
}