SPADE:结构化剪枝与自适应蒸馏用于高效 LLM-TTS
音频与语音处理
2026-01-30 v3 声音
摘要
本文旨在引入 SPADE 框架,用于结构化剪枝和自适应蒸馏以提高大型语言模型文本转语音(LLM-TTS)的效率。近期的 LLM-TTS 系统实现了强大的可控性和零样本泛化能力,但其大量参数和高延迟限制了实际部署。SPADE 通过(i)基于基于词错误率的层重要性指数引导剪枝,以删除非关键 Transformer 层,随后(ii)多级知识蒸馏恢复自回归连贯性来实现此目标。零样本基准测试表明,SPADE 在保持接近感知质量的同时,将 Transformer 深度减半,显著降低显存使用,最高可实现 1.7 倍的实时因子提升,且仅使用不到原训练数据的 5%。这些结果表明,紧凑型 LLM-TTS 模型能够保持自然度和说话人相似度,同时实现实际的实时语音生成。音频样本可在 https://mm.kaist.ac.kr/projects/SPADE/ 查看。
关键词
引用
@article{arxiv.2509.20802,
title = {SPADE: Structured Pruning and Adaptive Distillation for Efficient LLM-TTS},
author = {Tan Dat Nguyen and Jaehun Kim and Ji-Hoon Kim and Shukjae Choi and Youshin Lim and Joon Son Chung},
journal= {arXiv preprint arXiv:2509.20802},
year = {2026}
}
备注
ICASSP 2026