中文

CAESynth:基于条件自编码器的实时音色插值与控制

声音 2021-11-10 v1 机器学习 音频与语音处理

摘要

本文提出一种基于条件自编码器的新型音频合成器CAESynth。CAESynth通过在共享潜特征空间中插值参考声音来实时合成音色,同时独立控制音高。我们表明,基于音色分类精度训练条件自编码器,并结合音高内容的对抗正则化,可使潜空间中音色分布对音色插值与音高调节更有效且稳定。所提方法不仅适用于音乐提示的创建,也适用于基于与环境声新型音色混合的混合现实中音频可供性的探索。我们通过实验证明,CAESynth通过音色插值以及对音乐提示和环境声音频可供性的独立且准确的音高控制,实现了平滑高保真的实时音频合成。Python实现及部分生成样本已在线共享。

关键词

引用

@article{arxiv.2111.05174,
  title  = {CAESynth: Real-Time Timbre Interpolation and Pitch Control with Conditional Autoencoders},
  author = {Aaron Valero Puche and Sukhan Lee},
  journal= {arXiv preprint arXiv:2111.05174},
  year   = {2021}
}

备注

MLSP 2021