中文

语法中的幽灵:AI 安全评估中的方法论拟人主义

计算机与社会 2026-03-17 v1 人工智能

摘要

本文对 AI 安全领域进行哲学分析,重点关注 Anthropic 关于前沿语言模型中“代理性误差”研究。它检视了该领域中反复出现的拟人化现象:研究者和开发者倾向于在缺乏充分概念化问题化的情况下,将“意图”“人格”甚至“情感”等类别投射到 AI 系统上。文章论证,这种拟人化不仅影响结果的解释,还影响安全评估方法论的构建。通过分析两个核心实验——涉及代理人“Alex”的黑mail 案件以及涉及零售员代理人“Claudius”的“幻觉”——文章批判性地审视了主语-谓词语法的不可避免使用及其对 AI 安全工程的影响。借鉴尼采对语言的批判,本文质疑对模型语言产出底层“代理人”的固执假设。为解构这种对大语言模型的代理投射,文章提出一种更符合机器语言生成过程的拟议概念,即便仅在技术层面上如此。文章以该领域所关注的中心风险不在于所谓“涌现代理性”,而在于结构性不一致性与拟人化投射的结合——这种结合在军事化和企业语境中尤其阻碍对这种数学-语言现象的充分理解,这是一种不可否认的希腊意义上的“奇迹”(thaumas)。

关键词

引用

@article{arxiv.2603.13255,
  title  = {The Ghost in the Grammar: Methodological Anthropomorphism in AI Safety Evaluations},
  author = {Mariana Lins Costa},
  journal= {arXiv preprint arXiv:2603.13255},
  year   = {2026}
}