中文

通过激活方向驾驭代码 LLM 以实现语言和库控制

机器学习 2026-03-30 v2

摘要

代码 LLM 在中性提示下常常偏好特定编程语言和库。我们研究了这些偏好是否编码为激活空间中约为线性的方向,从而可以在推理时对其进行操控。使用差分均值方法,我们估计了五种语言/库配对的各层驾驶向量,并在生成过程中将其添加到模型隐藏状态中。对于三种开源权重代码 LLM,这些干预在中性提示下显著增加了对目标生态系统的生成,而且即使在提示明确请求相反选择时也常常保持有效。驾驶强度因模型和目标而异,常见生态系统比稀有选项更容易诱发,过强的干预也可能降低输出质量。总体而言,我们的结果表明,代码风格偏好在 LLM 中部分由激活空间中紧凑、可驾驶的结构所表示。

关键词

引用

@article{arxiv.2603.23629,
  title  = {Steering Code LLMs with Activation Directions for Language and Library Control},
  author = {Md Mahbubur Rahman and Arjun Guha and Harshitha Menon},
  journal= {arXiv preprint arXiv:2603.23629},
  year   = {2026}
}