中文

规模化 Transformer 用于低比特率高质量语音编码

音频与语音处理 2024-12-02 v1 人工智能 机器学习 声音 信号处理

摘要

语音的神经音频编解码模型分词是现代 AI 管道中用于语音生成或理解的关键环节,无论是单独使用还是在多模态上下文中。传统上,这类分词模型都集中于采用参数规模较小、仅包含强归纳偏置组件的架构。本文展示,通过对该问题进行规模化的 Transformer 架构(大参数规模),并应用基于有限标量量化(FSQ)的瓶颈结构,能够在极低的比特率(400400700700 比特/秒)下实现领先的语音质量。训练后的模型在客观和主观测试中均显著优于现有基线方法。

关键词

引用

@article{arxiv.2411.19842,
  title  = {Scaling Transformers for Low-Bitrate High-Quality Speech Coding},
  author = {Julian D Parker and Anton Smirnov and Jordi Pons and CJ Carr and Zack Zukowski and Zach Evans and Xubo Liu},
  journal= {arXiv preprint arXiv:2411.19842},
  year   = {2024}
}