学习得越好,剪枝越智能:通过可微 Token 剪枝迈向高效的视觉-语言-动作模型
摘要
我们提出了 LightVLA,一个简单而有效的针对视觉-语言-动作(VLA)模型的可微 token 剪枝框架。尽管 VLA 模型在执行现实世界机器人任务方面展现了令人瞩目的能力,但其在资源受限平台上的部署往往受到大量视觉 token 上繁重的基于注意力的计算瓶颈的限制。LightVLA 通过对视觉 token 进行自适应的、性能驱动的剪枝来应对这一挑战:它生成动态查询以评估视觉 token 的重要性,并采用 Gumbel softmax 来实现可微的 token 选择。通过微调,LightVLA 学会保留最具信息量的视觉 token,同时剪枝对任务执行无贡献的 token,从而同时提高效率和性能。值得注意的是,LightVLA 不需要启发式魔数且不引入额外的可训练参数,使其与现代推理框架兼容。实验结果表明,LightVLA 在 LIBERO 基准的多样化任务中优于不同的 VLA 模型和现有的 token 剪枝方法,在大幅降低计算开销的同时实现了更高的成功率。具体而言,LightVLA 分别减少了 59.1% 的 FLOPs 和 38.2% 的延迟,同时任务成功率提高了 2.6%。同时,我们还研究了带有额外可训练参数的基于可学习查询的 token 剪枝方法 LightVLA*,该方法也取得了令人满意的性能。我们的工作揭示,随着 VLA 追求最优性能,LightVLA 自发地学会从性能驱动的角度剪枝 token。据我们所知,LightVLA 是首个将自适应视觉 token 剪枝应用于 VLA 任务并以效率和性能为附带目标的工作,标志着向更高效、更强大和更实用的实时机器人系统迈出了重要一步。
引用
@article{arxiv.2509.12594,
title = {The Better You Learn, The Smarter You Prune: Towards Efficient Vision-language-action Models via Differentiable Token Pruning},
author = {Titong Jiang and Xuefeng Jiang and Yuan Ma and Xin Wen and Bailin Li and Kun Zhan and Peng Jia and Yahui Liu and Sheng Sun and Xianpeng Lang},
journal= {arXiv preprint arXiv:2509.12594},
year = {2025}
}
备注
Under review. Project site: https://liauto-research.github.io/LightVLA