MAP:多人类价值对齐调色板
人工智能
2024-10-28 v1 计算机与社会
新兴技术
人机交互
机器学习
摘要
确保生成式 AI 系统与人类价值观保持一致是必不可少的,但在考虑多个人类价值及其潜在权衡时,这一目标备受挑战。由于人类价值观可以是个性化的,并且随时间动态变化,因此不同族群、行业部门和用户群体对价值对齐的理想程度各不相同。在现有框架下,难以同时在多个方向上定义人类价值观并进行 AI 系统对齐,例如无害性、有用性和积极性。为此,我们发展了一种基于第一性原理的新方法,称为多人类价值对齐调色板(MAP),其结构化可靠地导航跨多个人类价值的对齐问题。MAP 将对齐问题 formulation 为一个具有用户定义约束的优化任务,这些约束定义了人类价值目标。它可以通过原始-对偶方法高效求解,从而确定用户定义的对齐目标是否可实现,以及如何实现。我们通过量化价值之间的权衡、约束的敏感性、多价值对齐与顺序对齐之间的根本联系,以及证明线性加权奖励足以实现多价值对齐等理论分析来详细阐述 MAP。大量实验表明,MAP 能够以原则方式对齐多个价值,同时在各种任务中实现卓越的实证性能。
引用
@article{arxiv.2410.19198,
title = {MAP: Multi-Human-Value Alignment Palette},
author = {Xinran Wang and Qi Le and Ammar Ahmed and Enmao Diao and Yi Zhou and Nathalie Baracaldo and Jie Ding and Ali Anwar},
journal= {arXiv preprint arXiv:2410.19198},
year = {2024}
}