中文

Command-V:通过激活轮廓粘贴 LLM 行为

机器学习 2025-06-25 v1

摘要

为大型语言模型(LLM)配备新行为,通常需要进行全参数微调或需要高昂distillation成本的步骤,且必须为每个架构重复上述过程。本文引入Command-V,一种无需反向传播的行为迁移方法,通过复制来自捐赠模型的现有残差激活适配器并将其粘贴到收件模型中来实现行为迁移。Command-V对小提示集上的层激活进行轮廓化,推导出对应层之间的线性转换器,并将捐赠干预应用于收件模型的激活空间中。这一过程无需访问原始训练数据,且计算需求极低。在三个案例研究中——安全拒绝增强、破解促进和自动链式思维推理——Command-V在使用计算资源数量上远低于直接微调,同时匹配或超越直接微调的性能。我们的代码和数据可在 https://github.com/GithuBarry/Command-V/ 访问。

关键词

引用

@article{arxiv.2506.19140,
  title  = {Command-V: Pasting LLM Behaviors via Activation Profiles},
  author = {Barry Wang and Avi Schwarzschild and Alexander Robey and Ali Payani and Charles Fleming and Mingjie Sun and Daphne Ippolito},
  journal= {arXiv preprint arXiv:2506.19140},
  year   = {2025}
}