中文

AntiPaSTO:基于反平行表示的自监督诚实引导

机器学习 2026-05-13 v5

摘要

随着模型能力的提升,人类难以可靠地验证它们所说的内容。可扩展的引导方法需要是内置的、自监督的,并能在分布外迁移;现有方法满足其中一些但并非全部三者。我们引入AntiPaSTO,通过沿反平行轴分离表示(+1/-1产生相反的位移),并通过一致性约束防止坍缩。训练仅使用两种对比词插入模板句子,无需偏好标签。当我们在Gemma-3-1B上使用800个此类合成配对时,AntiPaSTO在DailyDilemmas上的Steering F1比提示基线提升6.9倍,在6个测试价值轴中获胜。我们还发现其在保持双向控制方面具有初步证据,而提示则触发拒绝。

关键词

引用

@article{arxiv.2601.07473,
  title  = {AntiPaSTO: Self-Supervised Honesty Steering via Anti-Parallel Representations},
  author = {Michael J. Clark},
  journal= {arXiv preprint arXiv:2601.07473},
  year   = {2026}
}

备注

Code is available at https://github.com/wassname/AntiPaSTO