中文

通过后转换器适配器纠正语言模型中被抑制的对数概率

计算与语言 2026-04-20 v2 机器学习

摘要

对齐调优后的语言模型在政治敏感话题上常抑制事实相关的对数概率,尽管其隐藏表示中保留了相关知识。我们展示了一个约78.6K参数(约占基础模型的0.02%)的后转换器适配器,可在冻结隐藏状态上进行训练,纠正Qwen3-4B、8B和14B等模型在31个意识形态判别事实上的抑制问题。该适配器记忆了所有15个训练事实,并在每个规模的5个随机划分中对11-39%的16个保留事实进行泛化,实现零知识回归。无论是带门控(SwiGLU)还是无门控(线性瓶颈)适配器,效果相当;两者均无显著优势(在所有规模下Fisher精确检验p > 0.09)。在指令模型上,该适配器纠正了对数概率排序。在生成过程中应用于所有token位置会导致输出不连贯;但仅在当前预测位置(即最后位置)应用时,适配器可生成连贯且较少被审查的文本。后置于token投影后的logit空间适配器无法在任何应用模式下产生连贯的生成,表明隐藏状态干预是生成纠正的正确层级。我们发现,Apple MLX中存在一个先前未记录的静默梯度错误,解释了此工作早期迭代中所有空结果:标准模式nn.value_and_grad(model, fn)(model.parameters())在不报错情况下返回零梯度;正确模式nn.value_and_grad(model, fn)(model, data)可解决此问题。我们提供最小复现示例并讨论了对其他使用MLX的适配器研究的影响。

关键词

引用

@article{arxiv.2604.14174,
  title  = {Correcting Suppressed Log-Probabilities in Language Models with Post-Transformer Adapters},
  author = {Bryan Sanchez},
  journal= {arXiv preprint arXiv:2604.14174},
  year   = {2026}
}

备注

12 pages, 3 figures, code at https://github.com/SolomonB14D3/qwen-adapter-correction