压缩与释放:通过使隐藏幻觉浮现为安全信号来暴露它们
机器学习
2026-03-31 v1 人工智能
摘要
语言模型在直接被询问时能够检测到错误前提,但在对话压力下会吸收它们,从而基于它们已经识别出的错误生成权威的专业输出。这种失败——顺序差距幻觉——对输出检查是不可见的,因为错误迁移到了安全电路的激活空间中,被抑制但未被擦除。我们引入了压缩与释放(S&R),一种具有两个组件的激活修补架构:一个固定的检测器主体(第24-31层,局部化安全评估电路)和一个可交换的检测器核心(一个控制感知方向的激活向量)。安全核心将模型从服从转向检测;吸收核心则逆转这一过程。我们在OLMo-2 7B上使用顺序差距基准进行评估——跨越500个领域的500条链,全部由人工评分。关键发现:级联崩溃几乎是完全的(O5处99.8%的服从度);检测器主体是二元的且局域化的(第24-31层偏移93.6%,第0-23层贡献为零,p<10^-189);一个合成工程化的核心释放了76.6%的崩溃链;检测是更稳定的吸引子(83%恢复对比58%抑制);并且认知特异性得到确认(错误前提核心释放45.4%,真实前提核心释放0.0%)。该贡献在于框架——主体/核心架构、基准和核心工程方法论——其设计是模型无关的。
引用
@article{arxiv.2603.26829,
title = {Squish and Release: Exposing Hidden Hallucinations by Making Them Surface as Safety Signals},
author = {Nathaniel Oh and Paul Attie},
journal= {arXiv preprint arXiv:2603.26829},
year = {2026}
}