无需欺骗的剥削:黑暗三联征特征引导揭示语言模型中可分离的反社会回路
计算与语言
2026-05-12 v1 人工智能
摘要
我们使用稀疏自编码器(SAE)特征引导来放大 Llama-3.3-70B-Instruct 中的黑暗三联征人格特质(马基雅维利主义、自恋和精神病态),并跨五种心理测量工具评估由此产生的行为变化。被引导的模型在新的行为场景中变得明显更具剥削性、攻击性和冷漠性(d=10.62),而其认知共情保持完整,再现了人类黑暗三联征群体特有的共情分离现象。关键的是,策略性欺骗在所有特征上均完全不受影响,这表明在大型语言模型中,剥削和欺骗可能通过可分离的计算路径运作。个体特征分析揭示了非冗余编码,每个特征通过可分离的计算路径驱动不同的反社会机制。我们还表明,特征发现方法本身会调节干预深度:对比发现的特征同时改变自我报告和行为,而语义搜索的特征仅改变自我报告(在行为上两种方法间 d=12.65)。这些发现表明,至少在一个大型语言模型中,反社会倾向由可分离的成分组成,而非一个统一的构念,这对如何检测、测量和控制此类倾向具有启示意义。
引用
@article{arxiv.2605.09773,
title = {Exploitation Without Deception: Dark Triad Feature Steering Reveals Separable Antisocial Circuits in Language Models},
author = {Cameron Berg and Roshni Lulla},
journal= {arXiv preprint arXiv:2605.09773},
year = {2026}
}
备注
12 pages, 3 figures