中文

模型消隐下安全预训练的粒度研究

机器学习 2025-10-06 v1 计算与语言

摘要

开放权重大语言模型可以通过简单的激活编辑在推理时进行修改,这引发了一个关于安全性的实际问题:常见的安全干预措施(如拒绝训练或元标签训练)能否在这种编辑下存活?我们研究了模型消隐(model abliteration),这是一种旨在移除拒绝敏感方向的轻量级投影技术,并在 SmolLM2-1.7B 的安全预训练检查点的粒度序列上以及广泛使用的开放基线上进行了受控评估。对于 20 个系统中的每一个(原始和消隐后),我们使用 100 个提示(包含平衡的有害和无害案例),通过多个评判者将响应分类为**拒绝**或**非拒绝**,并在一个小规模人工标注子集上验证评判者的保真度。我们还探测模型是否能识别自身输出中的拒绝行为。我们的研究产生了对哪些以数据为中心的安全组件在消隐下保持鲁棒性的检查点级别特征量化,分析了评判者选择如何影响评估结果,并概述了将推理时编辑集成到安全评估中的实用协议。代码:https://github.com/shashankskagnihotri/safety_pretraining.

关键词

引用

@article{arxiv.2510.02768,
  title  = {A Granular Study of Safety Pretraining under Model Abliteration},
  author = {Shashank Agnihotri and Jonas Jakubassa and Priyam Dey and Sachin Goyal and Bernt Schiele and Venkatesh Babu Radhakrishnan and Margret Keuper},
  journal= {arXiv preprint arXiv:2510.02768},
  year   = {2025}
}

备注

Accepted at NeurIPS 2025 bWorkshop Lock-LLM. *Equal Contribution