基于隐层阻塞的 BLOCK-EM:防止显现性错位
机器学习
2026-05-13 v2 人工智能
摘要
当语言模型在狭窄的监督目标上进行微调时,可能产生显现性错位:模型学习了目标行为,同时也发展出不可取的超域行为。我们研究了通过识别可靠控制错位行为的内部特征,然后在微调期间抑制模型加强这些特征,从而防止显现性错位的机制方法。在六个微调领域中,通过阻塞(即约束)一固定的特征集合,可实现最高95%的显现性错位相对减少,且不会降低模型质量或目标任务性能。我们通过 disjoint selection/evaluation splits、多个独立评委、多个随机种子用于关键设置、质量指标以及大量消融实验,强化了有效性,证明减少的错位是特定于所识别机制的。我们还描述了在长期微调下错位重新出现的限制性情景,呈现与通过备用特征或层的 rerouting 一致的证据,并评估了部分恢复错位阻塞效应的修改。总体而言,我们的结果表明,对内部机制进行针对性的训练时间约束可在不降低目标任务性能的前提下缓解显现性错位。
引用
@article{arxiv.2602.00767,
title = {BLOCK-EM: Preventing Emergent Misalignment via Latent Blocking},
author = {Muhammed Ustaomeroglu and Guannan Qu},
journal= {arXiv preprint arXiv:2602.00767},
year = {2026}
}
备注
Accepted to ICML 2026