个性化神经语音编解码器
声音
2024-04-02 v1 音频与语音处理
摘要
在本文中,我们提出了一种个性化神经语音编解码器,设想个性化可以降低模型复杂度或提高感知语音质量。尽管语音编解码器的常见使用场景中通信双方仅涉及单一说话人,但文献中却鲜有探索为特定用户个性化编解码器的研究。首先,我们假设可以根据说话人的感知相似性将其分组为更小的子集。然后,我们还假设特定组的编解码器可以专注于该组的语音特征,从而提高其感知质量和计算效率。为此,我们首先开发了一个Siamese网络,从LibriSpeech数据集中学习说话人嵌入,随后将其聚类为潜在的说话人簇。最后,我们在每个说话人簇上重新训练基于LPCNet的语音编解码器基线。主观听力测试表明,所提出的个性化方案在保持语音质量的同时实现了模型压缩。换言之,在相同模型复杂度下,个性化编解码器能产生更好的语音质量。
引用
@article{arxiv.2404.00791,
title = {Personalized Neural Speech Codec},
author = {Inseon Jang and Haici Yang and Wootaek Lim and Seungkwon Beack and Minje Kim},
journal= {arXiv preprint arXiv:2404.00791},
year = {2024}
}