中文

音频语言模型的分段剪枝

声音 2025-11-19 v1 机器学习

摘要

近期的音频语言模型在广泛的音频任务上表现突出,能够处理较长的音频输入。然而,这些模型的计算成本高度依赖于序列长度,这在音频数据特性下会变得非常大。在视觉语言领域,token 剪枝方法在保持在标准基准测试上强大性能的同时,有效减少了 token 数量。在本工作中,我们研究了此类 token 选择策略在音频语言模型上下文中的相关性和有效性。我们通过提出一种考虑时间维度的轻量级策略来改进这些方法。虽然仅保留初始 token 的四分之一,我们的方法在 Clotho v2 上实现了约 2% 的 CIDEr 分数相对最大下降,在 MMAU 上实现了约 4% 的准确率相对最大下降。

关键词

引用

@article{arxiv.2511.14293,
  title  = {Segmentwise Pruning in Audio-Language Models},
  author = {Marcel Gibier and Raphaël Duroselle and Pierre Serrano and Olivier Boeffard and Jean-François Bonastre},
  journal= {arXiv preprint arXiv:2511.14293},
  year   = {2025}
}

备注

Submitted to ICASSP 2026 (under review)