中文

音频 Transformer 中的 token 剪枝:优化性能与解码 patch 重要性

声音 2025-10-27 v2 人工智能 音频与语音处理

摘要

视觉 Transformer (ViT) 在 various computer vision tasks 中取得了最先进的性能,但其高计算成本仍是一个挑战。token 剪枝被提出为通过有选择地删除不重要的 token 来降低此成本。虽然在视觉任务中通过丢弃非目标区域来有效实现,但将此技术应用于音频任务存在独特挑战,因为在时频表示中区分相关与不相关区域较为直接。在本研究中,我们首次将 token 剪枝应用于基于 Mel 频谱图的 ViT 音频分类模型,并分析模型性能与计算成本之间的权衡:TopK token 剪枝可使 AudioMAE 和 AST 的 MAC 操作减少 30-40%,准确率下降不到 1%。我们的分析发现,尽管高强度或高变动的 token 对模型准确率贡献显著,但在应用 token 剪枝时,低强度或低变动的 token 仍然重要;仅基于信号在 patch 上的强度或变动进行剪枝会导致准确率显著下降。我们通过测量注意力得分与这些统计特征之间的高相关性,并表明保留下的 token 与被剪枝的 token 在注意力上具有显著差异来支持我们的论点。我们还指出,AudioMAE 比 AST 保留更多低强度的 token。这可以解释为 AudioMAE 的自监督重建目标鼓励对所有 patch 注意力,而 AST 的监督训练则聚焦于与标签相关的 token。

关键词

引用

@article{arxiv.2504.01690,
  title  = {Token Pruning in Audio Transformers: Optimizing Performance and Decoding Patch Importance},
  author = {Taehan Lee and Hyukjun Lee},
  journal= {arXiv preprint arXiv:2504.01690},
  year   = {2025}
}

备注

Accepted at the 28th European Conference on Artificial Intelligence (ECAI 2025). Source code is available at https://github.com/andylee-24/token-pruning-audio-transformer