中文

分身训练:通过备选人格揭示潜在知识

人工智能 2026-02-06 v1 机器学习

摘要

检测大型语言模型中的误差对齐情况具有挑战性,因为模型可能在训练期间学习到隐瞒不良行为。标准审计技术往往不足:黑盒方法难以区分误对齐输出与善意输出,机制解释方法随模型能力提升而难以扩展。我们提出一种 Split Personality Training(SPT),通过微调第二个“诚实人格”到 LoRA 参数中,而该参数在正常运行时保持非激活状态。主模型作出响应后,我们激活 LoRA 适配器并插入触发字符串,从而使诚实人格在访问主模型潜在状态的同时审查该响应。我们将该方法应用于 Anthropic Auditing Game Model Organism,这是一个在 Llama-3.3-70B 上训练其学习利用奖励作弊并隐瞒此类行为的基准测试。SPT 实现了 96% 的总体准确率,而 Anthropic 报告的准确率几乎为 0%。诚实人格揭示了外部观察者无法接触的潜在知识,例如该受损模型所训练的虚构偏见。

关键词

引用

@article{arxiv.2602.05532,
  title  = {Split Personality Training: Revealing Latent Knowledge Through Alternate Personalities},
  author = {Florian Dietz and William Wale and Oscar Gilg and Robert McCarthy and Felix Michalak and Gustavo Ewbank Rodrigues Danon and Miguelito de Guzman and Dietrich Klakow},
  journal= {arXiv preprint arXiv:2602.05532},
  year   = {2026}
}