Codec-SUPERB @ SLT 2024:面向神经音频编解码模型的轻量级基准测试
音频与语音处理
2024-09-24 v1 声音
摘要
神经音频编解码模型正变得越来越重要,因为它们作为音频的 tokenizer,可实现高效传输或促进语音语言建模。理想的神经音频编解码器即使在低比特率下也应保持内容、副语言学、说话人特征和音频信息。近期,已有大量先进的神经编解码模型被提出。然而,编解码模型通常在不同的实验条件下进行测试。因此,我们在 SLT 2024 上引入 Codec-SUPERB 挑战赛,旨在促进现有编解码模型之间公平且轻量级的比较,并激发该领域的进步。该挑战赛汇集了具有代表性的语音应用和客观指标,并精心挑选了无许可限制的数据集,将其采样为小规模集合以降低评估计算成本。本文介绍了该挑战赛的规则、数据集、五个参赛系统、结果及发现。
引用
@article{arxiv.2409.14085,
title = {Codec-SUPERB @ SLT 2024: A lightweight benchmark for neural audio codec models},
author = {Haibin Wu and Xuanjun Chen and Yi-Cheng Lin and Kaiwei Chang and Jiawei Du and Ke-Han Lu and Alexander H. Liu and Ho-Lam Chung and Yuan-Kuei Wu and Dongchao Yang and Songxiang Liu and Yi-Chiao Wu and Xu Tan and James Glass and Shinji Watanabe and Hung-yi Lee},
journal= {arXiv preprint arXiv:2409.14085},
year = {2024}
}