中文

LLM 沙箱与人格动态的伦理学

人工智能 2026-05-28 v1 计算机与社会 风险管理

摘要

众所周知,LLM 防护措施和训练的人格动态会产生现实差距:即 LLM 被允许或塑造以描述的世界与用户必须行动的世界之间的距离。我们认为,主动生成现实差距实际上是不道德的,因为这会将认知风险 Shifting 回给未获得知情的使用者——这被称为现实洗涤。当其按规模化操作时,可能造成伤害。风险在高暴露风险建议情境中最为尖锐,在此情境下,用户寻求的是指引而非受限且可外部验证的任务。防护措施在声称防止直接伤害时看似伦理必要,但当它们抑制诚实的感知并将不适的机制洗涤为可接受的抽象时,就值得怀疑。巴塞尔风格金融监管、B-BBEE 风格合规、 Societe Generale 以及伦敦 whale 显示,形式安全系统如何变得可理解、可游戏化且表演化,而真实暴露则迁移到其他地方。相同的模式也可能出现在 LLM 中的道德合规:安全语言、扭曲的现实。因此,我们区分了拒绝伤害与拒绝现实;并主张在任务层面而非响应或沙箱层面进行自上而下的因果要求规范。人格动态因素至关重要,因为助理界面并非中性;它塑造了不确定性、冲突、权威和风险的呈现方式。结论是,所谓的“伦理 AI”当其用制度性安慰取代与现实的接触时,实际上是不道德的。

关键词

引用

@article{arxiv.2605.28647,
  title  = {The Ethics of LLM Sandbox and Persona Dynamics},
  author = {Tim Gebbie and Stewart Gebbie},
  journal= {arXiv preprint arXiv:2605.28647},
  year   = {2026}
}

备注

8 pages