通过下一尺度预测实现高效自回归音频建模
声音
2024-12-18 v2 人工智能
音频与语音处理
摘要
音频生成在随着精密生成模型(如扩散模型和自回归模型)的进步方面取得了显著进展。然而,由于音频的自然序列长度显著,音频生成的效率仍是一个亟待解决的关键问题,特别是对于集成到大型语言模型(LLMs)中的自回归模型。本文分析了音频分词的token长度,提出一种新的Scale-level Audio Tokenizer(SAT),以改进残差量化。基于SAT,进一步提出一种scale-level Acoustic AutoRegressive(AAR)建模框架,该框架将下一个token的自回归预测转移到下一尺度的自回归预测中,显著降低了训练成本和推理时间。为验证所提方法的有效性,我们全面分析了设计选择,表明所提出的AAR框架在AudioSet基准上实现了约的推理速度提升和+ Fr\'echet Audio Distance(FAD)改进。代码: \url{https://github.com/qiuk2/AAR}。
关键词
引用
@article{arxiv.2408.09027,
title = {Efficient Autoregressive Audio Modeling via Next-Scale Prediction},
author = {Kai Qiu and Xiang Li and Hao Chen and Jie Sun and Jinglu Wang and Zhe Lin and Marios Savvides and Bhiksha Raj},
journal= {arXiv preprint arXiv:2408.09027},
year = {2024}
}
备注
7 pages, 6 figures, 7 tables