规制基于LLM的智能体的能动性
计算机与社会
2025-09-30 v1 人工智能
摘要
随着能力越来越强的基于大语言模型(LLM)的智能体被开发出来,由对齐失调和失控造成的潜在危害也相应加剧。为应对这些风险,我们提出了一种直接测量和控制这些AI系统能动性的方法。我们将基于LLM的智能体的能动性概念化为一个独立于智能相关度量的属性,并与关于能动性概念的跨学科文献保持一致。我们提供:(1)将能动性作为一个系统属性,沿着偏好刚性、独立操作和目标持久性维度进行操作化;(2)一种用于测量和控制基于LLM的智能体能动性的表征工程方法;以及(3)由该方法实现的监管工具:强制性测试协议、特定领域的能动性限制、基于能动性进行风险定价的保险框架,以及防止社会规模风险的能动性上限。我们将我们的方法视为朝着降低那些催生“科学家AI”范式的风险迈出的一步,同时仍能从有限的智能体行为中获取一些益处。
引用
@article{arxiv.2509.22735,
title = {Regulating the Agency of LLM-based Agents},
author = {Seán Boddy and Joshua Joseph},
journal= {arXiv preprint arXiv:2509.22735},
year = {2025}
}
备注
4 pages