面向扩散语言模型的 Sink-Aware 剪枝
计算与语言
2026-02-20 v1 人工智能
机器学习
摘要
扩散语言模型(DLMs)由于迭代去噪,导致推理成本高昂,激发了高效剪枝的需求。现有的剪枝启发式 largely 来自自回归(AR)LLM,通常保留注意力 sink token,因为 AR sink 作为稳定的全局锚点。我们指出,这一假设对 DLMs 不成立:注意力-sink 位置在完整生成轨迹上表现出显著的方差(通过衡量主导 sink 位置在不同时间步中的位移来衡量),表明 sink 往往是暂时的且不够结构essential于 AR 模型。基于这一观察,我们提出 ,自动识别并修剪 DLMs 中的不稳定 sink(以前的研究通常保留 AR LLM 的 sink)。在无需重新训练的情况下,我们的方法在质量-效率权衡方面表现更好,并在匹配计算预算下超越了强大的先前剪枝基线。我们的代码已公开于 https://github.com/VILA-Lab/Sink-Aware-Pruning。
引用
@article{arxiv.2602.17664,
title = {Sink-Aware Pruning for Diffusion Language Models},
author = {Aidar Myrzakhan and Tianyi Li and Bowei Guo and Shengkun Tang and Zhiqiang Shen},
journal= {arXiv preprint arXiv:2602.17664},
year = {2026}
}
备注
Code at: https://github.com/VILA-Lab/Sink-Aware-Pruning