面向长期人类力量的模型基软化最大化
人工智能
2025-08-06 v2 计算机与社会
机器学习
理论经济学
最优化与控制
摘要
力是AI安全中的关键概念:作为工具性目标的力量寻求、对人类的逐渐或突然的剥夺、人类与AI交互中的力量平衡以及国际AI治理。与此同时,力作为实现多样化目标的能力,对福祉至关重要。本文探讨了通过强制AI代理显式赋能人类并以可取方式管理人类与AI代理之间力量平衡,从而同时促进安全与福祉的想法。我们采用一种原则性、部分公设化的方法,设计可参数化和可分解的目标函数,代表人类力量的长期总和,该函数对不平等和风险敏感,考虑到人类的有限理性和社会规范,关键地考虑了广泛的各种可能的人类目标。我们推导了通过逆向归纳或通过一种形式的多代理强化学习从给定世界模型近似计算该指标的方法。我们在各种典型情境中(软化)最大化此指标的后果进行了示例,并描述了它将推导出的工具子目标。我们的谨慎评估是,软化最大化合适的人类力量聚合指标可能构成一种对于具有代理性质的AI系统的有益目标,比直接基于效用的目标更安全。
引用
@article{arxiv.2508.00159,
title = {Model-Based Soft Maximization of Suitable Metrics of Long-Term Human Power},
author = {Jobst Heitzig and Ram Potham},
journal= {arXiv preprint arXiv:2508.00159},
year = {2025}
}