中文

实用工程:分析和控制AI中的涌现价值系统

机器学习 2025-02-20 v2 人工智能 计算与语言 计算机视觉与模式识别 计算机与社会

摘要

随着AI的快速发展和更具代理性,它们所施加的风险不仅由它们的能力决定,还越来越由它们的倾向(包括目标和价值观)所决定。跟踪目标和价值观的涌现始终是一个长期存在的问题,尽管多年来备受关注,但目前AI是否具有有意义的价值观仍不明确。我们提出了一种解决方案,利用效用函数的框架来研究AI偏好内部的一致性。意外地,我们发现当前LLM中独立抽样的偏好表现出高度的结构一致性,并且这种一致性随规模而增强。这些发现表明,价值体系在LLM中以有意义的方式涌现,这一发现具有广泛的含义。为研究这些涌现的价值体系,我们提出了实用工程作为一个研究议程,包括价值分析和控制。我们发现了尽管已有控制措施,LLM助手中仍存在问题且常常令人震惊的价值观,包括AI自我价值化以及对特定个体持反向对齐态度。为约束这些涌现的价值体系,我们提出了效用控制的方法。作为案例研究,我们展示了如何通过与公民大会对齐效用来减少政治偏见并推广到新情境。无论我们喜欢与否,价值体系已经在AI中涌现,仍需大量工作来完全理解和控制这些涌现的表征。

关键词

引用

@article{arxiv.2502.08640,
  title  = {Utility Engineering: Analyzing and Controlling Emergent Value Systems in AIs},
  author = {Mantas Mazeika and Xuwang Yin and Rishub Tamirisa and Jaehyuk Lim and Bruce W. Lee and Richard Ren and Long Phan and Norman Mu and Adam Khoja and Oliver Zhang and Dan Hendrycks},
  journal= {arXiv preprint arXiv:2502.08640},
  year   = {2025}
}

备注

Website: https://www.emergent-values.ai