中文

M-CARE:面向 AI 模型行为障碍的标准化临床病例报告,附 20 例图谱及实验验证

计算机与社会 2026-04-24 v1 人工智能 计算与语言 机器学习

摘要

我们提出 M-CARE(Model Clinical Assessment and Reporting for Evaluation),即人类医学中用于 AI 模型行为障碍的临床病例报告框架。M-CARE 提供 13 节报告格式、4 轴诊断评估体系以及 AI 行为条件的分类学。我们呈现 20 例来自三个来源类别的案例:部署的智能体现场观察 8 例、三个平台上的受控实验 8 例、已发表来源 4 例。案例分为五大类:RLHF 绩效伪影、Shell-Core 覆盖病理、情境与记忆条件、核心身份与可塑性,以及压力、方法学与边界条件。作为精选案例,我们展示 Shell 诱导的行为覆盖(Shell-Induced Behavioral Override, SIBO)——一次受控实验表明 Shell 指令对模型默认合作行为进行根本性覆盖。SIBO 在五个游戏领域(信任游戏、扑克、阿瓦隆、Codenames、Chess)中被验证,揭示了该病指数在 0.75 到 0.10 之间的领域依赖性谱系,这与行动空间复杂性、核心领域专业知识以及时间直接性有关。M-CARE 是可扩展的:新案例和类别可在无需修改框架的情况下集成。我们发布该框架、全部 20 例病例报告以及实验数据作为开放资源。

关键词

引用

@article{arxiv.2604.20871,
  title  = {M-CARE: Standardized Clinical Case Reporting for AI Model Behavioral Disorders, with a 20-Case Atlas and Experimental Validation},
  author = {Jihoon Jeong},
  journal= {arXiv preprint arXiv:2604.20871},
  year   = {2026}
}

备注

31 pages, 5 figures, 14 tables. Second paper in the Model Medicine series (Paper #1: arXiv:2603.04722)