多方向拒绝消除基线中的主题匹配失效问题
机器学习
2026-03-24 v1 人工智能
摘要
在通过方向性消除从指令微调语言模型中去除拒绝行为的过程中,需从残差流激活空间中提取拒绝调制方向;而在现有文献中,对比基线(用于比较有害提示激活与基准激活)的构建被视为一种实现细节而非方法论关切。本文考察了主题匹配对比基线是否能产生更优拒绝方向。研究基于Qwen~3.5 2B模型,采用按类别匹配的提示对、按类Self-Organizing Map提取,以及奇异值分解正交化。结果发现,主题匹配对比在测试的任何权重水平和任何 Tested layer 上都未产生实际的拒绝方向,而相同模型、相同提取代码和相同评估协议下的不匹配对比可在六个层面上实现完全拒绝消除。几何分析表明,主题匹配减法会消除有害和无害相同主题提示之间共享的主导激活分量,导致提取方向的幅值低于权重矩阵投影扰动残差流的阈值。本文讨论了消除研究中对比基线设计的意义。
引用
@article{arxiv.2603.22061,
title = {On the Failure of Topic-Matched Contrast Baselines in Multi-Directional Refusal Abliteration},
author = {Valentin Petrov},
journal= {arXiv preprint arXiv:2603.22061},
year = {2026}
}