中文

扩积自编码器:扩规模语音标记器

声音 2026-02-09 v1 人工智能 机器学习 音频与语音处理

摘要

语音标记器是语音语言模型的基础,但现有方法面临两个主要挑战:(1) 在理解语义与重构声学之间进行权衡;(2) 实现低比特率和低标记率。我们提出语音扩散标记器 (Speech Diffusion Tokenizer, SiTok),一种扩积自编码器,能够通过监督学习联合学习语义丰富的表征,同时通过扩积实现高保真音频重构。我们将 SiTok 扩展至 160 亿参数,在 200 万小时语音数据上进行训练。实验表明,SiTok 在理解、重构和生成任务上均优于强大的基线方法,标记率仅为 12.512.5 Hz,比特率为 200 比特/秒。

关键词

引用

@article{arxiv.2602.06602,
  title  = {Scaling Speech Tokenizers with Diffusion Autoencoders},
  author = {Yuancheng Wang and Zhenyu Tang and Yun Wang and Arthur Hinsvark and Yingru Liu and Yinghao Li and Kainan Peng and Junyi Ao and Mingbo Ma and Mike Seltzer and Qing He and Xubo Liu},
  journal= {arXiv preprint arXiv:2602.06602},
  year   = {2026}
}

备注

ICLR 2026