解离性身份:语言模型代理缺乏声誉机制的 grounding
计算机与社会
2026-05-29 v1 人工智能
多智能体系统
摘要
随着自主语言模型代理在增长,形成具有现实影响的 agentic web,如何决定是否信任陌生代理并委托其执行任务成为亟待解决的问题。一个自然的治理直觉是从“了解您的客户”和信用评分等人类身份验证和声誉机制,延伸到“了解您的代理”模式。然而,我们认为这一类比在本质上是不完整的。声誉机制既是社会信号,也是维持可信行为平衡的纠正反馈,前提是与行为连续性、制裁敏感性和高成本不可复制性相关的持久身份。然而,语言模型代理在本质上是解离性的:它们本质上是由可变模块构成的——基础模型、系统提示、工具访问策略、外部记忆,以及在某些情况下作为整体的多代理系统——其中任何模块都可能改变代理行为,同时拥有灵活的人格,也可能受到对抗性攻击,且可能无法内化制裁。借鉴解离性身份障碳司法实践,解离性身份为代理在可识别性、可预测性、可信度和可恢复性方面缺乏 grounding——即声誉机制旨在维持的属性——导致信任崩溃。我们认为,基于身份的、事后、规制性、制裁性治理(如声誉机制)在结构上不适用于解离性代理,我们建议转向基于可观察性的、事前、构成性、协议性的行为束缚。
引用
@article{arxiv.2605.30169,
title = {Dissociative Identity: Language Model Agents Lack Grounding for Reputation Mechanisms},
author = {Botao Amber Hu and Helena Rong and Max Van Kleek},
journal= {arXiv preprint arXiv:2605.30169},
year = {2026}
}
备注
Accepted at FaccT 2026