中文

规制基于LLM的智能体的能动性

计算机与社会 2025-09-30 v1 人工智能

摘要

随着能力越来越强的基于大语言模型(LLM)的智能体被开发出来,由对齐失调和失控造成的潜在危害也相应加剧。为应对这些风险,我们提出了一种直接测量和控制这些AI系统能动性的方法。我们将基于LLM的智能体的能动性概念化为一个独立于智能相关度量的属性,并与关于能动性概念的跨学科文献保持一致。我们提供:(1)将能动性作为一个系统属性,沿着偏好刚性、独立操作和目标持久性维度进行操作化;(2)一种用于测量和控制基于LLM的智能体能动性的表征工程方法;以及(3)由该方法实现的监管工具:强制性测试协议、特定领域的能动性限制、基于能动性进行风险定价的保险框架,以及防止社会规模风险的能动性上限。我们将我们的方法视为朝着降低那些催生“科学家AI”范式的风险迈出的一步,同时仍能从有限的智能体行为中获取一些益处。

关键词

引用

@article{arxiv.2509.22735,
  title  = {Regulating the Agency of LLM-based Agents},
  author = {Seán Boddy and Joshua Joseph},
  journal= {arXiv preprint arXiv:2509.22735},
  year   = {2025}
}

备注

4 pages