音频语言模型的分段剪枝
声音
2025-11-19 v1 机器学习
摘要
近期的音频语言模型在广泛的音频任务上表现突出,能够处理较长的音频输入。然而,这些模型的计算成本高度依赖于序列长度,这在音频数据特性下会变得非常大。在视觉语言领域,token 剪枝方法在保持在标准基准测试上强大性能的同时,有效减少了 token 数量。在本工作中,我们研究了此类 token 选择策略在音频语言模型上下文中的相关性和有效性。我们通过提出一种考虑时间维度的轻量级策略来改进这些方法。虽然仅保留初始 token 的四分之一,我们的方法在 Clotho v2 上实现了约 2% 的 CIDEr 分数相对最大下降,在 MMAU 上实现了约 4% 的准确率相对最大下降。
引用
@article{arxiv.2511.14293,
title = {Segmentwise Pruning in Audio-Language Models},
author = {Marcel Gibier and Raphaël Duroselle and Pierre Serrano and Olivier Boeffard and Jean-François Bonastre},
journal= {arXiv preprint arXiv:2511.14293},
year = {2025}
}
备注
Submitted to ICASSP 2026 (under review)