链路压缩的激活引导
人工智能
2025-07-09 v2 机器学习
摘要
大型语言模型(LLM)在包含中间步骤——即“思维链”(CoT)——时在复杂推理中表现出色。然而,这些推理过程往往过于冗长,即使针对简单问题也是如此,导致上下文浪费、延迟增加和能源消耗。我们观察到冗长且以英文为主的 CoT 与简洁且以数学为中心的 CoT 在模型残差流激活空间中占据不同区域。通过提取并注入一个“引导向量”以在这些模式之间转换,可以可靠地将生成引导 toward 更简洁的推理,从而在不重新训练的情况下压缩 CoT。我们将这一方法 formalize 为激活引导压缩(Activation-Steered Compression, ASC),这是一种推理时技术,通过直接修改隐藏表示来缩短推理轨迹。此外,我们提供了关于 ASC 对输出分布影响的理论分析,基于从闭式 KL 散度受限约束派生的引导强度调节。仅使用 100 对冗长和简洁示例,ASC 在 MATH500 和 GSM8K 数据集上实现了最高可达 67.43% 的 CoT 长度降低,同时在 7B、8B 和 32B 参数模型上保持准确率。作为一种无训练的方法,ASC 引入的运行时开销极小, 在 MATH500 上,8B 模型端到端推理 wall-clock 时间平均提速 2.73 倍。这使得 ASC 成为在延迟或成本敏感场景中部署具备推理能力的 LLM 的实用且高效工具。代码已公开:https://github.com/ArminAzizi98/ASC
引用
@article{arxiv.2507.04742,
title = {Activation Steering for Chain-of-Thought Compression},
author = {Seyedarmin Azizi and Erfan Baghaei Potraghloo and Massoud Pedram},
journal= {arXiv preprint arXiv:2507.04742},
year = {2025}
}