Codec-SUPERB:声音编解码器模型的深入分析
音频与语音处理
2024-09-19 v3 声音
摘要
声音编解码器在最小化数据传输延迟和充当令牌化器方面的双重作用凸显了其关键重要性。近年来,编解码器模型取得了显著发展。理想的声音编解码器应保留内容、副语言信息、说话人特征及音频信息。然而,哪种编解码器能实现最佳的声音信息保留这一问题仍未得到解答,因为在不同的论文中,模型是在其选定的实验设置下进行评估的。本研究引入了 Codec-SUPERB,即编解码器声音处理通用性能基准 (Codec sound processing Universal PERformance Benchmark) 的缩写。这是一个旨在基于声音领域知识,通过代表性声音应用和信号级指标来评估编解码器模型的生态系统。Codec-SUPERB 通过在线排行榜简化了结果共享,促进了社区驱动基准数据库内的协作,从而激发编解码器的新开发周期。此外,我们进行了深入分析,从应用和信号两个视角提供对编解码器模型的见解,这与以往主要集中于信号级比较的编解码器论文有所不同。最后,我们将发布代码、排行榜和数据,以加速社区内的进展。
引用
@article{arxiv.2402.13071,
title = {Codec-SUPERB: An In-Depth Analysis of Sound Codec Models},
author = {Haibin Wu and Ho-Lam Chung and Yi-Cheng Lin and Yuan-Kuei Wu and Xuanjun Chen and Yu-Chi Pai and Hsiu-Hsuan Wang and Kai-Wei Chang and Alexander H. Liu and Hung-yi Lee},
journal= {arXiv preprint arXiv:2402.13071},
year = {2024}
}
备注
Github: https://github.com/voidful/Codec-SUPERB