ESPnet-Codec:面向音频、音乐和语音的神经编解码器综合训练与评估平台
音频与语音处理
2025-02-25 v2 声音
摘要
神经编解码器已成为近期语音和音频生成研究的关键技术。除了信号压缩能力外,离散编解码器还被发现能提升下游训练效率以及与自回归语言模型的兼容性。然而,随着大量下游应用的研究深入,如何确保跨不同应用的公平比较成为了挑战。为解决这些问题,我们提出了一个新的开源平台 ESPnet-Codec,它基于 ESPnet 构建,专注于神经编解码器的训练与评估。ESPnet-Codec 提供了音频、音乐和语音领域的多种训练与评估方案,使用了多种广泛采用的编解码器模型。与 ESPnet-Codec 一同发布的还有 VERSA,一个独立的评估工具包,它通过超过 20 个音频评估指标对编解码器性能进行全面评估。值得注意的是,我们展示了 ESPnet-Codec 可以集成到六个 ESPnet 任务中,支持多样化的应用。
引用
@article{arxiv.2409.15897,
title = {ESPnet-Codec: Comprehensive Training and Evaluation of Neural Codecs for Audio, Music, and Speech},
author = {Jiatong Shi and Jinchuan Tian and Yihan Wu and Jee-weon Jung and Jia Qi Yip and Yoshiki Masuyama and William Chen and Yuning Wu and Yuxun Tang and Massa Baali and Dareen Alharhi and Dong Zhang and Ruifan Deng and Tejes Srivastava and Haibin Wu and Alexander H. Liu and Bhiksha Raj and Qin Jin and Ruihua Song and Shinji Watanabe},
journal= {arXiv preprint arXiv:2409.15897},
year = {2025}
}
备注
Accepted by SLT