离散语音标记的最新进展:综述
音频与语音处理
2025-12-15 v4 人工智能
多媒体
声音
信号处理
摘要
大语言模型 (LLM) 时代语音生成技术的快速发展已使离散语音标记成为语音表示的基础范式。这些标记具有离散、紧凑和简洁的特性,不仅有利于高效传输和存储,而且天然适合语言建模框架,使其能够无缝集成到以文本为主导的 LLM 架构中。当前研究将离散语音标记分为两个主要类别:声学标记和语义标记,每一种都发展成一个富有设计理念和方法论方法的丰富研究领域。本综述系统综合了现有分类法和最新创新,批判性地检视了每种范式的优势与局限性,并对不同标记类型进行系统实验比较。此外,我们识别了该领域的持续挑战,提出了潜在的研究方向,旨在为未来在离散语音标记的开发和应用方面提供可操作的见解。
引用
@article{arxiv.2502.06490,
title = {Recent Advances in Discrete Speech Tokens: A Review},
author = {Yiwei Guo and Zhihan Li and Hankun Wang and Bohan Li and Chongtian Shao and Hanglei Zhang and Chenpeng Du and Xie Chen and Shujie Liu and Kai Yu},
journal= {arXiv preprint arXiv:2502.06490},
year = {2025}
}
备注
26 pages, 8 figures, 3 tables. Accepted to IEEE TPAMI