AntiPaSTO:基于反平行表示的自监督诚实引导
机器学习
2026-05-13 v5
摘要
随着模型能力的提升,人类难以可靠地验证它们所说的内容。可扩展的引导方法需要是内置的、自监督的,并能在分布外迁移;现有方法满足其中一些但并非全部三者。我们引入AntiPaSTO,通过沿反平行轴分离表示(+1/-1产生相反的位移),并通过一致性约束防止坍缩。训练仅使用两种对比词插入模板句子,无需偏好标签。当我们在Gemma-3-1B上使用800个此类合成配对时,AntiPaSTO在DailyDilemmas上的Steering F1比提示基线提升6.9倍,在6个测试价值轴中获胜。我们还发现其在保持双向控制方面具有初步证据,而提示则触发拒绝。
关键词
引用
@article{arxiv.2601.07473,
title = {AntiPaSTO: Self-Supervised Honesty Steering via Anti-Parallel Representations},
author = {Michael J. Clark},
journal= {arXiv preprint arXiv:2601.07473},
year = {2026}
}
备注
Code is available at https://github.com/wassname/AntiPaSTO