中文

表示干预是否真正识别期望概念并引发对齐?

机器学习 2025-05-27 v1 机器学习

摘要

表示干预旨在定位和修改编码底层概念的表示,以引发对齐且符合预期的行为。尽管实证成果令人满意,但从未检验过是否可以定位干预的忠实概念。在本工作中,我们探讨了在安全对齐方面的这个问题。如果干预是忠实的,则被干预的大语言模型应抹去有害概念,并对分布内对抗提示以及分布外 (OOD) 越狱保持鲁棒性。虽然在线性设置下可以在不降低 LLM 良好功能的前提下抹去有害概念,但我们展示在一般非线性设置下则不可行。为解决此问题,我们提出了概念浓度 (COCA)。COCA 通过显式推理过程重新构筑训练数据,首先识别潜在的有害概念,然后决定响应。本质上,COCA 简化了有害与良好表示之间的决策边界,实现更有效的线性抹除。对多种表示干预方法和模型架构进行大量实验表明,COCA 显著降低了分布内和 OOD 越狱成功率,同时保持在数学和代码生成等常规任务上的强大性能。

关键词

引用

@article{arxiv.2505.18672,
  title  = {Does Representation Intervention Really Identify Desired Concepts and Elicit Alignment?},
  author = {Hongzheng Yang and Yongqiang Chen and Zeyu Qin and Tongliang Liu and Chaowei Xiao and Kun Zhang and Bo Han},
  journal= {arXiv preprint arXiv:2505.18672},
  year   = {2025}
}

备注

Hongzheng and Yongqiang contributed equally; project page: https://causalcoat.github.io/coca