中文

DASH:基于马尔可夫决策策略的输入感知动态层跳过高效 LLM 推理

计算与语言 2025-05-26 v1 机器学习

摘要

大型语言模型(LLM)在广泛的 NLP 任务中取得了显著的性能,但其巨大的推理成本是面向实际部署的主要障碍,尤其是在延迟敏感的场景中。为此,我们提出了 DASH(Input-Aware Dynamic Layer Skipping for Efficient LLM Inference with Markov Decision Policies),一种基于输入特征动态选择计算路径的自适应层跳过框架。我们将跳过过程建模为马尔可夫决策过程(MDP),以基于中间表示进行细粒度的 token 级决策。为缓解跳过可能导致的性能下降,我们引入轻量级的补偿机制,将差分奖励注入决策过程中。此外,我们设计了一种异步执行策略,将层计算与策略评估重叠,以最小化运行时开销。在多个 LLM 架构和 NLP 基准测试上进行实验表明,我们的方法在保持具竞争力的任务性能的同时,实现了显著的推理加速,超越了现有方法。

关键词

引用

@article{arxiv.2505.17420,
  title  = {DASH: Input-Aware Dynamic Layer Skipping for Efficient LLM Inference with Markov Decision Policies},
  author = {Ning Yang and Fangxin Liu and Junjie Wang and Tao Yang and Kan Liu and Haibing Guan and Li Jiang},
  journal= {arXiv preprint arXiv:2505.17420},
  year   = {2025}
}

备注

8 pages,5 figures