中文

少走少读:通过无调优多模态令牌剪枝提升视觉语言导航效率

计算机视觉与模式识别 2025-09-23 v2 人工智能

摘要

大模型在视觉语言导航(VLN)任务上表现强劲,但在资源受限环境中运行成本高昂。令牌剪枝在几乎不损失性能的情况下提供了诱人的效率权衡,但先前工作忽略了 VLN 特有的挑战。例如,剪枝导致的信息损失可能因更长的行走路径而实际增加计算成本。因此,无法识别无信息令牌会削弱剪枝本应带来的效率增益。为此,我们提出了导航感知剪枝(Navigation-Aware Pruning, NAP),利用导航特定特征简化剪枝过程,通过预过滤将令牌分为前景和背景。例如,根据智能体是否可在该方向导航来过滤图像视图。我们还利用大语言模型提取与导航相关的指令。过滤后,我们将剪枝重点放在背景令牌上,最小化信息损失。为进一步避免导航长度增加,我们通过移除低重要性导航节点来抑制回溯。在标准 VLN 基准上的实验表明,NAP 显著优于先前工作,在节省超过 50% FLOPS 的同时保持了更高的成功率。

关键词

引用

@article{arxiv.2509.15250,
  title  = {Walk and Read Less: Improving the Efficiency of Vision-and-Language Navigation via Tuning-Free Multimodal Token Pruning},
  author = {Wenda Qin and Andrea Burns and Bryan A. Plummer and Margrit Betke},
  journal= {arXiv preprint arXiv:2509.15250},
  year   = {2025}
}

备注

Accepted to EMNLP 2025. Data and code to be released at https://github.com/wdqin/VLN-NAP