基于分布匹配与分布式置换干预的可信双向模型引导
机器学习
2026-03-17 v2 计算与语言
摘要
干预式模型引导作为一种轻量且可解释的替代方案,相较于提示工程和微调方法而言更具优势。然而,当前方法过度借鉴微调的强优化目标,易产生过拟合,常表现不佳且生成不自然的输出。我们假设,有效的引导源于对内部模型机制的忠实识别,而非对外部偏好的强制实现。基于分布式对齐搜索(DAS)——因变量定位的标准方法——我们提出新的引导方法:概念 DAS(CDAS)。我们沿用 DAS 的核心机制(分布置换干预,DII),但引入针对引导任务的新型分布匹配目标,通过对齐干预后输出分布与反事实分布来实现。CDAS 与现有工作的区别在于:其一,采用弱监督分布匹配而非概率最大化来学习干预;其二,使用天然支持双向引导的 DII,使引导因子可从数据中推导,减少 hyperparameter 调参需求,实现更忠实、更稳定的控制。在大型模型引导基准 AxBench 上,我们发现 CDAS 并不总是优于偏好优化方法,但随模型规模增大效果更佳。在两个安全相关案例研究中,CDAS 成功覆盖了安全对齐模型的拒绝行为,并中和了链式思考后门,实现了系统性引导,同时保持了模型的通用实用性。这些结果表明,CDAS 与偏好优化方法是互补的,且在特定条件下构成干预式模型引导的稳健方法。我们的代码已公开于 https://github.com/colored-dye/concept_das。
引用
@article{arxiv.2602.05234,
title = {Faithful Bi-Directional Model Steering via Distribution Matching and Distributed Interchange Interventions},
author = {Yuntai Bao and Xuhong Zhang and Jintao Chen and Ge Su and Yuxiang Cai and Hao Peng and Bing Sun and Haiqin Weng and Liu Yan and Jianwei Yin},
journal= {arXiv preprint arXiv:2602.05234},
year = {2026}
}
备注
camera ready version; 55 pages, 25 figures; accepted for ICLR 2026