基于残差掩码和时域一致性的人声去混响
声音
2025-10-02 v1 音频与语音处理
摘要
人声去混响在音频处理中仍是一个具有挑战性的任务,尤其是在实时应用中,需要兼顾准确性和效率。传统深度学习方法往往难以在抑制混响而不损害人声清晰度方面取得佳绩,而最近采用联合预测幅值和相位的方法又计算成本较高。我们提出一种基于残差掩码预测的实时去混响框架,构建于短时傅里叶变换 (STFT) 域。训练一个 U-Net 架构来估计一种残差混响掩码,以抑制晚期反射,同时保留直接语音成分。采用结合二元交叉熵、残差幅值重建和时域一致性的混合目标函数,进一步鼓励准确抑制和感知质量。这些组件共同作用,使本方法具备适用于实际语音和歌声应用的低延迟特性。
引用
@article{arxiv.2510.00356,
title = {Dereverberation Using Binary Residual Masking with Time-Domain Consistency},
author = {Daniel G. Williams},
journal= {arXiv preprint arXiv:2510.00356},
year = {2025}
}
备注
6 pages, 1 figure