中文

某些[Body] 必须承受痛苦方能实现 Agent 的问责

计算机与社会 2026-05-19 v1 人工智能

摘要

AI 代理日益在现实世界中产生性地行动。这引发我们所称的" consequence reception "问题:伤害发生,产生系统被识别,但没有继续的代理以方式改变未来行为。疼痛, mechanistically 理解为纠正性反馈信号,是经典惩罚理论的基础—— deterrence、rehabilitation、retribution 和 incapacitation 都假设存在一个持续的 locus 来注册该信号并更新行为。这反过来需要一个 body 让该信号落在其中:一个保护其完整性的边界、信号积聚的 locus、将 episodic signal 转化为持久 update 的 consolidation,以及一种会通过改变未来行动来响应该体的基质。当前的 LLM 代理——由权重、提示、工具、记忆和凭证组成的软件定义复合体,自由地被交换、复制、重置和重新组装——不满足上述任何条件。因此,两种 prevailing 法律响应未能实现 consequence reception。薄身份的 agent-principal dyad 有 body 但没有 consequence--agency coupling:人类为超出其控制范围的行为承受痛苦—— Elish 的"道德崩溃区"。厚身份的 Arbel 等人的"Algorithmic Corporation" 创建了法律可理解的实体,但不保证任何 AI decision architecture 接收到作为行为信号的痛苛。实现 consequence-agency coupling 因此是一个 sociotechnical 基础设施问题,而不仅仅是一个法律问题。直到存在此类架构,高风险的 AI 部署应保持与具有可理解控制、比例责任和约束或终止该代理权力的可负责任的人类 principal 相系。*If some body does not receive the pain by design, some body will receive it by default.*

关键词

引用

@article{arxiv.2605.16872,
  title  = {Some[Body] Must Receive That Pain for Agent Accountability},
  author = {Botao Amber Hu and Helena Rong},
  journal= {arXiv preprint arXiv:2605.16872},
  year   = {2026}
}