中文

零样态单声道到双声道语音合成

声音 2025-05-29 v2 机器学习 音频与语音处理

摘要

我们提出了 ZeroBAS(零样态单声道到双声道语音合成),这是一种无需在任何双声道数据上进行训练,即可从单声道音频录音和位置信息合成双声道音频的神经方法。据我们了解,这是首个已发表的零样态神经方法用于单声道到双声道音频合成。具体而言,我们表明,基于源位置的无参数几何时间错位和�幅缩放足以获得初始的双声道合成结果,可通过迭代应用预训练的降噪声码器进行细化。进一步,我们发现这导致了对房间条件的泛化,我们通过引入新数据集 TUT Mono-to-Binaural 来评估在未见条件下的最新单声道到双声道合成方法的表现。我们的零样态方法在标准单声道到双声道数据集上的感知表现与监督方法相当甚至在我们的离分布 TUT Mono-to-Binaural 数据集上更优。我们的结果凸显了预训练生成式音频模型和零样态学习在实现稳健双声道音频合成方面的潜力。

关键词

引用

@article{arxiv.2412.08356,
  title  = {Zero-Shot Mono-to-Binaural Speech Synthesis},
  author = {Alon Levkovitch and Julian Salazar and Soroosh Mariooryad and RJ Skerry-Ryan and Nadav Bar and Bastiaan Kleijn and Eliya Nachmani},
  journal= {arXiv preprint arXiv:2412.08356},
  year   = {2025}
}