中文

WAND:面向高效自回归文本到语音模型的窗口注意力与知识蒸馏

计算与语言 2026-04-13 v1 人工智能

摘要

最近的解码器专用自回归文本到语音(AR-TTS)模型产生高保真语音,但其内存和计算成本随序列长度呈二次增长。本文提出WAND(窗口注意力与知识蒸馏),一个框架,使预训练的AR-TTS模型拥有恒定的计算和内存复杂度。WAND将注意力机制分为两部分:对条件token的持久全局注意力,和对生成token的局部滑动窗口注意力。为稳定微调,我们采用渐进收紧注意力窗口的课程学习策略。进一步利用来自全注意力教师的知识蒸馏,以提高数据效率恢复高保真合成质量。在三款现代AR-TTS模型上评估,WAND保留原始质量,实现最高66.2%的KV缓存内存减少和长度不变的近常数per-step延迟。

关键词

引用

@article{arxiv.2604.08558,
  title  = {WAND: Windowed Attention and Knowledge Distillation for Efficient Autoregressive Text-to-Speech Models},
  author = {Hanna Lee and Tan Dat Nguyen and Jaehoon Kang and Kyuhong Shim},
  journal= {arXiv preprint arXiv:2604.08558},
  year   = {2026}
}

备注

Submitted to Interspeech 2026