中文

大语言模型的心理驾驶

计算与语言 2026-04-17 v1

摘要

大语言模型(LLM)模拟出一致的人类似 behavior,可以通过激活水平干预来塑造。这种范式正在向 additive residual-stream 注入趋势,这些注入依赖于注入强度扫描来近似最佳干预设置。然而,现有方法限制了搜索空间并在未校准的激活空间单位中扫描,可能错过最佳干预条件。因此,我们引入一种心理驾驶框架,在语义校准的单位中执行无界且受流畅约束的扫描。我们的方法使用心理学 artifacts 派生和校准 residual-stream 注入,并使用 IPIP-NEO-120 来衡量 OCEAN 人格模型,以比较六种注入方法。我们发现,平均差(MD)注入在 14 中 11 个 LLM 中的开放式生成中超过 Personality Prompting(P2^2),这是一种用于 OCEAN 驾驶的已建立基线,提升幅度为 3.6% 到 16.4%,推翻了此前报告的偏好提示的结果,并将表示工程定位为开放式心理驾驶的新前沿。进一步,我们发现 P2^2 和 MD 注入的混合体在 14 个 LLM 中的 13 个中优于两种方法,P2^2 的提升幅度为 5.6% 到 21.9%,MD 注入的提升幅度为 3.3% 到 26.7%。最后,我们表明 MD 注入与线性表示假设一致,为心理驾驶提供可靠的约线性控制旋钮。然而,它们也会引起 OCEAN 特征协变量模式,这些模式偏离了 Big Two 模型,表明所学表示与人类心理学之间存在差距。

关键词

引用

@article{arxiv.2604.14463,
  title  = {Psychological Steering of Large Language Models},
  author = {Leonardo Blas and Robin Jia and Emilio Ferrara},
  journal= {arXiv preprint arXiv:2604.14463},
  year   = {2026}
}

备注

66 pages, 60 images