中文

利用非侵入式质量估计控制分离语音的重混音

音频与语音处理 2023-03-24 v1 声音

摘要

对分离出的音频源进行重混音,需要在干扰衰减量与可听失真程度之间权衡。本文提出一种非侵入式音频质量估计方法,以信号自适应方式控制该权衡。近期提出的 2f 模型被采用为底层质量度量,因其已被证明与源分离中的基本音频质量强相关。我们提出了该度量的一种替代操作模式,在考虑目标源具有较长非活跃段素材时更为合适。2f 模型需要参考目标源作为输入,但在许多应用中并不可得。我们训练深度神经网络(DNN)以侵入式利用参考目标估计 2f 模型(iDNN2f)、以输入混合为参考的非侵入式(nDNN2f)、以及仅利用分离输出信号的无参考式(rDNN2f)。结果表明,iDNN2f 在测试数据上与原度量相关性极强(Pearson r=0.99),而 nDNN2f(r>=0.91)与 rDNN2f(r>=0.82)性能下降。非侵入式估计 nDNN2f 被映射以选择依赖于条目的重混音增益,目标是在重混音输出最低质量约束下(例如可听但不恼人的失真)最大化干扰衰减。听音测试表明,即使所选增益差异很大(高达 23 dB),该目标也成功达成。

关键词

引用

@article{arxiv.2107.10151,
  title  = {Controlling the Remixing of Separated Dialogue with a Non-Intrusive Quality Estimate},
  author = {Matteo Torcoli and Jouni Paulus and Thorsten Kastner and Christian Uhle},
  journal= {arXiv preprint arXiv:2107.10151},
  year   = {2023}
}

备注

Manuscript accepted for the 2021 IEEE Workshop on Applications of Signal Processing to Audio and Acoustics