中文

“黑三人组”模型生物体:窄域精调镜像人类反社会行为

计算与语言 2026-03-10 v1 人工智能 神经元与认知

摘要

对齐问题指的是关于强大智能体确保与人类偏好和价值相容的关注。当前的大型语言模型(LLMs)显示出误对齐的行为,如战略欺骗、操纵和奖励寻求,尽管经过安全训练仍可出现。获得对这些失败的机制性理解需要能够在受控环境中隔离行为模式的经验方法。我们提出生物学误对齐先于人工误对齐,并利用人格的“黑三人组”(狂妄、幽默和马基雅维利主义)作为构建误对齐模型生物体的心理学框架。在研究1中,我们建立了对黑三人组特征在人类群体(N=318)中全面的行为轮廓,识别出情感不协调作为连接这些特征的核心同情缺失,以及特征特定的道德推理与欺骗行为模式。在研究2中,我们证明通过在验证的心理测量仪器上进行狭窄微调,可可靠地在前沿LLMs中诱导黑色人格。狭小的训练数据集(仅36个心理测量项目)即可导致行为测度显著偏移, closely mirror human antisocial profiles。关键的是,模型在训练项目之外进行了推理,表现出情境外推理而非记忆。这些发现揭示了LLMs中潜在的人格结构可通过狭窄干预被激活,将“黑三人组”定位为在生物与人工智能之间诱导、检测和理解误对齐的验证框架。

关键词

引用

@article{arxiv.2603.06816,
  title  = {"Dark Triad" Model Organisms of Misalignment: Narrow Fine-Tuning Mirrors Human Antisocial Behavior},
  author = {Roshni Lulla and Fiona Collins and Sanaya Parekh and Thilo Hagendorff and Jonas Kaplan},
  journal= {arXiv preprint arXiv:2603.06816},
  year   = {2026}
}

备注

38 pages, 17 figures