中文

面向诚实语言模型的深度激活引导

机器学习 2025-12-09 v1

摘要

大语言模型有时会断言虚假信息,尽管其内部表征了正确答案,这是诚实性而非准确性的失败,从而削弱了可审计性和安全性。现有方法大多优化事实正确性,或依赖重新训练和脆弱的单层编辑,对真实报告的控制力有限。我们提出了一种无需训练的激活引导方法,通过高斯调度在网络深度上加权引导强度。在将诚实性与知识性分离的 MASK 基准上,我们评估了涵盖 LLaMA、Qwen 和 Mistral 家族的七个模型,发现高斯调度在七个模型中的六个上优于无引导和单层基线。在 LLaMA-3.1-8B-Instruct 和 Qwen-2.5-7B-Instruct 上的等预算消融实验表明,高斯调度优于随机、均匀和盒式滤波深度分配,表明引导在深度上的分布方式对结果的影响超越了总强度。该方法简单、模型无关、无需微调,并为从模型现有能力中激发真实报告提供了一个低成本控制旋钮。

关键词

引用

@article{arxiv.2512.07667,
  title  = {Depth-Wise Activation Steering for Honest Language Models},
  author = {Gracjan Góral and Marysia Winkels and Steven Basart},
  journal= {arXiv preprint arXiv:2512.07667},
  year   = {2025}
}

备注

See \url{https://github.com/marysia/gaussian-activation-steering}. for code and experiments