中文

使用神经音频编解码器的潜在颗粒重合成

声音 2025-07-28 v1 机器学习 音频与语音处理 信号处理

摘要

我们引入了一种新颖的创意音频重合成技术,该技术通过在潜在向量层面重新构思颗粒合成的概念来运作。我们的方法通过将源音频语料库编码成潜在向量片段来创建一个“颗粒码本”,然后将目标音频信号的每个潜在颗粒与码本中最接近的对应项进行匹配。生成的混合序列被解码,以产生保留目标时间结构同时采用源音色特征的音频。该技术无需模型训练,适用于多种音频材料,并通过解码过程中编解码器的隐式插值自然避免了传统拼接合成中典型的间断问题。我们在 https://github.com/naotokui/latentgranular/ 提供了补充材料,并在 https://huggingface.co/spaces/naotokui/latentgranular 提供了一个概念验证实现,允许用户用自己的声音进行实验。

关键词

引用

@article{arxiv.2507.19202,
  title  = {Latent Granular Resynthesis using Neural Audio Codecs},
  author = {Nao Tokui and Tom Baker},
  journal= {arXiv preprint arXiv:2507.19202},
  year   = {2025}
}

备注

Accepted at ISMIR 2025 Late Breaking Demos