面向大语言模型的相对动力学效用:基于推理感知的结构化剪枝
机器学习
2026-05-12 v1 计算与语言
摘要
链路思考(CoT)提示标志着大语言模型(LLM)推理能力的重大提升。然而,扩大测试时计算规模会导致大量 CoT 序列,引入严重的推理延迟和键值(KV)缓存内存瓶颈。虽然结构化剪枝提供了一种根本、面向硬件的解决方案来缓解静态参数负担,但现有的幅度方法可能切断 CoT 的神经元:它们过度依赖离散交叉熵目标,陷入“幅度陷阱”,优先高频低信息语法标记,在高稀疏度(如 40%)时触发令人失望的推理崩溃。为克服这一拓扑相变,我们提出了相对动力学效用(RKU),这一一种新理论框架,将离散剪枝提升为基于交替梯度流(AGF)在模型深度流形上的连续动力学积分。通过引入 Fisher 迹归一化,RKU 作为一种轻量级曲率感知归一化,隔离动力学尖峰——负责高曲率逻辑路由的基本结构通道。广泛实验表明,在 Qwen-2.5-7B 和 LLaMA-3-8B 上的 RKU 在约 40% 稀疏度的高稀疏 regime 中提升性能。RKU 在 40% 稀疏度下在 GSM8K 上达到 13.34% 的准确率,超越最强基线,似乎在分布外评估中更好地保留了推理相关的表示。
引用
@article{arxiv.2605.09008,
title = {Relative Kinetic Utility for Reasoning-Aware Structural Pruning in Large Language Models},
author = {Tianhao Qian},
journal= {arXiv preprint arXiv:2605.09008},
year = {2026}
}
备注
15 pages, 3 figures