AI 对齐与社会选择:根本局限与政策启示
人工智能
2023-10-25 v1 计算与语言
计算机与社会
人机交互
机器学习
摘要
将 AI 智能体对齐到人类意图与价值观是构建安全且可部署 AI 应用的关键瓶颈。但 AI 智能体应对齐于谁的价值观?基于人类反馈的强化学习(RLHF)已成为 AI 对齐的关键框架。RLHF 使用人类反馈者的反馈来微调输出;所有广泛部署的大语言模型(LLMs)都使用 RLHF 将其输出对齐到人类价值观。理解 RLHF 的局限并考量这些局限带来的政策挑战至关重要。本文研究构建尊重民主规范的 RLHF 系统时的一个具体挑战。基于社会选择理论中的不可能性结果,我们表明在相当宽泛的假设下,不存在通过民主流程利用 RLHF 普遍对齐 AI 系统的唯一投票协议。进一步,我们表明将 AI 智能体对齐到所有个体的价值观总会违背某个体用户的某些私人伦理偏好,即使用 RLHF 的普适 AI 对齐是不可能的。我们讨论了基于 RLHF 构建的 AI 系统治理的政策启示:第一,需要强制透明投票规则以使模型构建者问责;第二,模型构建者需聚焦于开发窄对齐到特定用户群的 AI 智能体。
引用
@article{arxiv.2310.16048,
title = {AI Alignment and Social Choice: Fundamental Limitations and Policy Implications},
author = {Abhilash Mishra},
journal= {arXiv preprint arXiv:2310.16048},
year = {2023}
}
备注
10 pages, no figures