中文

基于浅层扩散的无监督歌声音降调恢复

声音 2026-01-16 v1

摘要

升调是歌声制作中的 essential 功能之一。然而,传统信号处理方法已知存在诸多权衡,如形态移位和机器人色彩,在升调跨度更大时问题更为严重。本文旨在通过将其重新表述为恢复问题来实现歌声的高质量升调:给定已进行升调(因此受到artifact污染)的音频轨道,我们恢复自然的演绎声音,同时保留其旋律和节奏。具体而言,我们使用由帧级声学特征(如f0、音量和内容特征)驱动的轻量级时域扩散模型。我们以自监督方式构建训练对,通过施加升调并对其进行逆转来模拟真实的artifact,同时保留ground truth。 在精选的歌声数据集上,所提出的方法在语音学指标和成对声学测量中显著降低了升调artifact。结果表明,基于恢复的升调是实现抗artifact升调在人声制作工作流程中可行的可行方法。

关键词

引用

@article{arxiv.2601.10345,
  title  = {Self-supervised restoration of singing voice degraded by pitch shifting using shallow diffusion},
  author = {Yunyi Liu and Taketo Akama},
  journal= {arXiv preprint arXiv:2601.10345},
  year   = {2026}
}