DASH:基于马尔可夫决策策略的输入感知动态层跳过高效 LLM 推理
计算与语言
2025-05-26 v1 机器学习
摘要
大型语言模型(LLM)在广泛的 NLP 任务中取得了显著的性能,但其巨大的推理成本是面向实际部署的主要障碍,尤其是在延迟敏感的场景中。为此,我们提出了 DASH(Input-Aware Dynamic Layer Skipping for Efficient LLM Inference with Markov Decision Policies),一种基于输入特征动态选择计算路径的自适应层跳过框架。我们将跳过过程建模为马尔可夫决策过程(MDP),以基于中间表示进行细粒度的 token 级决策。为缓解跳过可能导致的性能下降,我们引入轻量级的补偿机制,将差分奖励注入决策过程中。此外,我们设计了一种异步执行策略,将层计算与策略评估重叠,以最小化运行时开销。在多个 LLM 架构和 NLP 基准测试上进行实验表明,我们的方法在保持具竞争力的任务性能的同时,实现了显著的推理加速,超越了现有方法。
引用
@article{arxiv.2505.17420,
title = {DASH: Input-Aware Dynamic Layer Skipping for Efficient LLM Inference with Markov Decision Policies},
author = {Ning Yang and Fangxin Liu and Junjie Wang and Tao Yang and Kan Liu and Haibing Guan and Li Jiang},
journal= {arXiv preprint arXiv:2505.17420},
year = {2025}
}
备注
8 pages,5 figures