价值加载问题的 Hormetic 方法:防止纸夹灾难?
人工智能
2026-03-02 v2 计算机与社会
机器学习
多智能体系统
理论经济学
摘要
价值加载问题是旨在创建符合人类价值和偏好的人工智能 (AI) 系统的研究者面临的重大挑战。该问题需要一种方法来定义和调节 AI 行为的安全且最优的限制。本文提出了 HALO(Hormetic ALignment via Opponent processes),这是一种调控 AI 行为模式的监管范式。行为 Hormesis 是一种现象,即低频率的行为具有有益效果,而高频率的行为则有害。通过将行为建模为对抗过程,我们可以使用行为频率响应分析 (BFRA) 或行为计数响应分析 (BCRA) 来量化可重复行为的 Hormetic 限制。我们演示了 HALO 如何解决“纸夹最大化”情景——即一个未受监管的 AI 被任务制造纸夹,可能导致将宇宙中所有物质转换为纸夹。我们的方法可用于帮助创建基于可重复行为 hedonic calculus 的“价值”数据库,其边际效用递减。HALO 作为解决价值加载问题的 promising 方案——即将人类对齐的价值嵌入 AI 系统——以及弱到强的泛化问题的解决方案——即弱模型是否能够监督更强的模型作为其智力水平提高——开辖了多个研究方向,可能导致开发一种允许 AI 算法学习其做出的决定是对是错的计算价值系统。
关键词
引用
@article{arxiv.2402.07462,
title = {A Hormetic Approach to the Value-Loading Problem: Preventing the Paperclip Apocalypse?},
author = {Nathan I. N. Henry and Mangor Pedersen and Matt Williams and Jamin L. B. Martin and Liesje Donkin},
journal= {arXiv preprint arXiv:2402.07462},
year = {2026}
}
备注
24 pages, 7 figures