通过 Transformer 潜在子空间激活来引导概念偏差
人工智能
2025-06-24 v1 机器学习
系统与控制
系统与控制
摘要
本工作探讨了通过激活语言模型(LLM)的潜在子空间是否可以引导科学代码生成倾向于特定编程语言。首先对五个因果 LLM 在科学编码提示下进行评估,以量化其在四种编程语言中的基线偏差。一种静态神经元归因方法,对最高激活的 MLP 权重进行 C++ 或 CPP 标记扰动,方法脆弱且在不同提示样式和模型规模之间表现出有限的泛化。为解决这些局限性,开发了一种梯度细化的自适应激活引导框架(G-ACT):对每个提示的激活差异进行聚类,形成少数引导方向,并在线训练和细化轻量级 per-layer 探针,以选择合适的引导向量。在 LLaMA-3.2 3B 中,该方法可靠地将生成倾向于 CPP 语言,通过将平均探针分类准确率提高 15%,前 6 层(0-6)相较于标准 ACT 框架提高了 61.5% 的探针分类准确率。对于 LLaMA-3.3 70B,由于注意力头信号变得更稀疏,关键层的有针对性注入仍可改善语言选择。虽然 per-layer 探针引入了适度的推理开销,但通过仅引导部分层仍然实用,并实现了可复现的模型行为。这些结果表明,这是一种可扩展、可解释且高效的机制,可实现实际 agent 系统的概念层面控制。
引用
@article{arxiv.2506.18887,
title = {Steering Conceptual Bias via Transformer Latent-Subspace Activation},
author = {Vansh Sharma and Venkat Raman},
journal= {arXiv preprint arXiv:2506.18887},
year = {2025}
}