SpeechPrune:面向语音信息检索的上下文感知 Token 剪枝
音频与语音处理
2025-04-01 v2 人工智能
计算与语言
声音
摘要
我们引入了语音信息检索(SIR),这是面向语音大型语言模型(Speech LLM)的一种新型长上下文任务,并提出了 SPIRAL,一个包含 1,012 个样本的基准测试,用于评估模型从约 90 秒的语音输入中提取关键细节的能力。尽管当前的 Speech LLM 在短文本任务上表现出色,但它们在处理更长音频序列的计算和表示需求时面临困难。为了解决这一局限性,我们提出了 SpeechPrune,一种免训练的 token 剪枝策略,该策略利用语音-文本相似度和近似注意力分数来高效丢弃无关 token。在 SPIRAL 中,SpeechPrune 在 20% 的剪枝率下,分别比原始模型和随机剪枝模型实现了 29% 和高达 47% 的准确率提升。即使在 80% 的剪枝水平下,SpeechPrune 仍能维持网络性能。该方法突显了 token 级剪枝在高效且可扩展的长语音理解方面的潜力。
引用
@article{arxiv.2412.12009,
title = {SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval},
author = {Yueqian Lin and Yuzhe Fu and Jingyang Zhang and Yudong Liu and Jianyi Zhang and Jingwei Sun and Hai "Helen" Li and Yiran Chen},
journal= {arXiv preprint arXiv:2412.12009},
year = {2025}
}
备注
Accepted at IEEE ICME 2025. Project page: https://speechprune.github.io/