BinauralFlow:基于流匹配模型的高质量双耳语音合成的因果可流式处理方法
声音
2025-05-30 v1 人工智能
音频与语音处理
摘要
双耳渲染旨在基于单声道音频以及说话者和听者的位置,合成模拟自然听觉的双耳音频。尽管已有许多方法被提出以解决此问题,但它们在渲染质量和可流式推理方面仍存在困难。合成与真实世界录音难以区分的高质量双耳音频,需要对双耳线索、房间混响和环境声进行精确建模。此外,真实世界应用需要流式推理。为了应对这些挑战,我们提出了一种基于流匹配的流式双耳语音合成框架,称为 BinauralFlow。我们将双耳渲染视为生成问题而非回归问题,并设计了条件流匹配模型来渲染高质量音频。此外,我们设计了一种因果 U-Net 架构,该架构仅基于过去信息估计当前音频帧,以使生成模型适应流式推理。最后,我们引入了连续推理流水线,结合流式 STFT/ISTFT 操作、缓冲库、中点求解器和早期跳过调度,以提高渲染连续性和速度。定量和定性评估证明了我们的方法优于 SOTA 方法。一项感知研究进一步表明,我们的模型几乎与真实世界录音难以区分,混淆率为 。
引用
@article{arxiv.2505.22865,
title = {BinauralFlow: A Causal and Streamable Approach for High-Quality Binaural Speech Synthesis with Flow Matching Models},
author = {Susan Liang and Dejan Markovic and Israel D. Gebru and Steven Krenn and Todd Keebler and Jacob Sandakly and Frank Yu and Samuel Hassel and Chenliang Xu and Alexander Richard},
journal= {arXiv preprint arXiv:2505.22865},
year = {2025}
}
备注
ICML 2025, 18 pages