中文

矢量量化的音色表示

音频与语音处理 2020-07-14 v1 机器学习

摘要

音色是一组识别不同声源类型的感知属性。尽管其定义通常难以捉摸,但从信号处理视角看,它可被视作所有独立于音高与响度而被感知的频谱特征。一些工作通过分析不同乐器的特征关系研究了高层音色合成,但声学属性仍相互纠缠且生成受限于个体声音。本文通过学习一组生成特征对其频谱属性的近似分解,旨在实现更灵活的个体音色合成。我们引入一种具有离散潜空间且与响度解耦的自编码器,以学习给定音色分布的量化表示。音色迁移可通过将任意变长输入信号编码为量化潜特征,并按所学音色解码来实现。我们详述了管弦乐器与歌唱声音间音频转换,以及从人声模仿到乐器迁移作为驱动声音合成的直观模态的结果。此外,我们可将离散潜空间映射至声学描述符并直接进行基于描述符的合成。

关键词

引用

@article{arxiv.2007.06349,
  title  = {Vector-Quantized Timbre Representation},
  author = {Adrien Bitton and Philippe Esling and Tatsuya Harada},
  journal= {arXiv preprint arXiv:2007.06349},
  year   = {2020}
}