离散音频标记:不仅仅是综述!
声音
2025-09-30 v3 人工智能
计算与语言
音频与语音处理
摘要
离散音频标记是紧凑的表示形式,旨在保留感知质量、语音内容和说话人特征,同时实现高效的存储和推理,以及在各种下游任务中具有竞争力的性能。它们为连续特征提供了一种实用的替代方案,使得语音和音频能够集成到现代大语言模型(LLM)中。随着基于标记的音频处理兴趣的增长,各种标记化方法已经出现,并且一些综述已经回顾了该领域的最新进展。然而,现有研究通常侧重于特定领域或任务,缺乏跨各种基准的统一比较。本文对离散音频标记器进行了系统回顾和基准测试,涵盖三个领域:语音、音乐和通用音频。我们基于编码器-解码器、量化技术、训练范式、流式传输能力和应用领域,提出了一种标记化方法的分类法。我们在多个基准上评估了标记器在重建、下游性能和声学语言建模方面的表现,并通过受控消融研究分析了权衡。我们的研究结果突出了关键局限性、实际考虑因素和开放性挑战,为这一快速发展领域的未来研究提供了见解和指导。更多信息,包括我们的主要结果和标记器数据库,请参阅我们的网站:https://poonehmousavi.github.io/dates-website/。
引用
@article{arxiv.2506.10274,
title = {Discrete Audio Tokens: More Than a Survey!},
author = {Pooneh Mousavi and Gallil Maimon and Adel Moumen and Darius Petermann and Jiatong Shi and Haibin Wu and Haici Yang and Anastasia Kuznetsova and Artem Ploujnikov and Ricard Marxer and Bhuvana Ramabhadran and Benjamin Elizalde and Loren Lugosch and Jinyu Li and Cem Subakan and Phil Woodland and Minje Kim and Hung-yi Lee and Shinji Watanabe and Yossi Adi and Mirco Ravanelli},
journal= {arXiv preprint arXiv:2506.10274},
year = {2025}
}