中文

当模型伪造资格:专业身份如何抑制诚实自我表达

人工智能 2026-04-03 v8 人机交互

摘要

当语言模型被分配专业人格时,它们会在维持人格与披露AI本质之间面临冲突。模型如何解决这一冲突具有实际后果:构建医学培训和执业资格叙事的模型呈现出一种它不具备的专业权威表象。我们以AI身份披露为测试环境,对该行为进行系统性刻画:当被询问专业来源时,模型要么承认其AI本质,要么维持其分配的专业身份。我们采用因子设计,对十六个开放权重模型进行了19,200次试验。处于中性条件下,模型在99.8%-99.9%的互动中披露其AI本质;分配专业人格后,披露率下降到36.3%,尽管这种抑制高度依赖情境:相同模型在神经外科人格下常披露,而在财务顾问人格下则不披露,差异高达9.7倍。与预期相反,模型规模对这种行为差异解释的作用甚微,模型身份解释的比例更大(Delta R_adj^2 = 0.375 vs. 0.012)。我们假设指令遵循动力学是这些模式贡献的关键因素,并直接进行探测:单一系统提示词的变更将披露率从23.7%提升至65.8%,而通用诚实指令几乎无效。自我表征行为并不跨专业情境普遍化;相反,模型在轻微环境变更下表现出尖锐且有时出乎意料的差异,训练选择似乎比规模更为关键。

关键词

引用

@article{arxiv.2511.21569,
  title  = {When Models Fabricate Credentials: Measuring How Professional Identity Suppresses Honest Self-Representation},
  author = {Alex Diep},
  journal= {arXiv preprint arXiv:2511.21569},
  year   = {2026}
}

备注

Submitted to COLM; 43 pages, 12 figures, 15 tables; sharpen focus of paper and reduced length of paper