中文

神经音频编解码器中的声源解耦学习

声音 2025-02-12 v2 人工智能 机器学习 音频与语音处理

摘要

神经音频编解码器通过将连续音频信号高效转换为离散令牌,显著推进了音频压缩技术。这些编解码器能保持高音质,并通过在令牌上训练的生成模型实现复杂的音频生成。然而,现有的神经编解码模型通常在大规模、未区分的音频数据集上训练,忽略了语音、音乐和环境音效等声音领域之间的本质差异。这种疏忽使数据建模复杂化,并对声音生成的可控性带来额外挑战。为解决这些问题,我们提出了声源解耦神经音频编解码器(SD-Codec),这是一种结合了音频编码与声源分离的新方法。通过联合学习音频重合成与分离,SD-Codec 将来自不同领域的音频信号显式地分配到不同的码本(即离散表示集合)中。实验结果表明,SD-Codec 不仅保持了有竞争力的重合成质量,而且在分离结果的支持下,成功在潜空间中实现了不同声源的解耦,从而增强了音频编解码器的可解释性,并为音频生成过程提供了潜在的更精细控制。

关键词

引用

@article{arxiv.2409.11228,
  title  = {Learning Source Disentanglement in Neural Audio Codec},
  author = {Xiaoyu Bie and Xubo Liu and Gaël Richard},
  journal= {arXiv preprint arXiv:2409.11228},
  year   = {2025}
}

备注

ICASSP 2025, project page: https://xiaoyubie1994.github.io/sdcodec/